Pith. sign in

Paper Citation Record · LEDGER

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

As of 22 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 1 inbound Pith citation observation for arXiv:2505.00853.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.00853 v1

Coverage vector

measured 100 of 100 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T04:37:48.388254Z

measured 101 of 101 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-12T04:22:06.172150Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 100 outbound references displayed

  • verified exact4
  • verified fuzzy28
  • unresolved66
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

1
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 399266f9-3a7d-45cd-948d-614047817435 · outbound

This paper cites Concrete Problems in AI Safety.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Concrete Problems in AI Safety

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.007229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.007229Z digest=sha256:d792c97b4113a9bd08ac2806a9eeee37158818772783f90966086dd3b7d431b9

Observation 87a759c4-0df4-4622-9955-5f1e1028daad · outbound

This paper cites Language Models as Agent Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Language Models as Agent Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.012655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.012655Z digest=sha256:f37b7f88bee2da9bafe04cd4b768def125c646846204244734cbd4ed908856cc

Observation 65d16a69-256e-430d-a598-18b95615c575 · outbound

This paper cites Claude: A conversational ai assistant.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Claude: A conversational ai assistant

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.017733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.017733Z digest=sha256:4a005ce13ea1752f78131c797b2a925946cf694c375466a3d08d65b6c8d29041

Observation 226c38bb-b7cf-4314-b128-74ae045d219d · outbound

This paper cites Aquino and A.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Aquino and A

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.021922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.021922Z digest=sha256:ef7d277693d8891e3dcdeb99facd7bfec984ed1be01e3d61e2762a78c00ddf1e

Observation 5e89fa7b-23d4-4a70-af01-9e1eef746caa · outbound

This paper cites Probing pre- trained language models for cross-cultural differences in values.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Probing pre- trained language models for cross-cultural differences in values

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.025997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.025997Z digest=sha256:9f44616997071e14451c0992f4189d3f10b7b0290dd5ea76bac989002cf594b6

Observation 618f7f45-c46e-40d5-a34c-59cdae90624f · outbound

This paper cites Awad et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Awad et al

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.030508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.030508Z digest=sha256:228d8069e30268bda1d799f6a3d91fd8fc85b865cfaf2f7ebc054566478281b9

Observation e7a16ad1-da38-467e-846b-3f9a2dc65cb1 · outbound

This paper cites Bandura et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Bandura et al

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.034769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.034769Z digest=sha256:394a5a5a4f1854373fb71f681d1463b411d19af79e87bf08dad0f726244e0af4

Observation 95217eeb-8146-4b2b-97c0-ad4c5642701d · outbound

This paper cites Bender, Timnit Gebru, Angelina McMillan-Major, and Shmargaret Shmitchell.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Bender, Timnit Gebru, Angelina McMillan-Major, and Shmargaret Shmitchell

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.038662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.038662Z digest=sha256:63be778e3550809043ac5a00474c7a1ba2403254c1e5aff877a5bf6f8b3abf08

Observation 98db0cb4-1696-4ddf-9587-928307ef7930 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models On the Opportunities and Risks of Foundation Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.042311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.042311Z digest=sha256:c1ff1076cc4a5f6c315227bca561c866877e78ee44f0804c125f5bb03a99f473

Observation 89e09f19-12a8-421e-96f0-ad952c2cc50f · outbound

This paper cites Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, et al

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.046294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.046294Z digest=sha256:6d2b4030099ed3f585e4881ba30ca3579175eedb3075d9acc17da5a8410e23bd

Observation 3458cb0b-d5b5-4251-bc86-7aa3ede1a61d · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.049762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.049762Z digest=sha256:ba1bcaff69ae8e0a48b1f77f3c37624790f8ffbfb5a2f2018a0613dfce1263a4

Observation 9dc6a800-24de-4508-9d68-1cfd0e5de0d9 · outbound

This paper cites When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.053037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.053037Z digest=sha256:dd83ce6976780df8b9bf450a2d265b25863376aa5fe65461369bb5f9aa194581

Observation c64fe085-af89-40b0-80cc-12065c02b274 · outbound

This paper cites Chalkidis et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Chalkidis et al

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.057165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.057165Z digest=sha256:53deff7339a4d77aaacade3087e42cdca67e70bd12b1234c3190456c7cefd9cb

Observation f73bd80d-f6ff-4030-8496-6ec0b32b7d25 · outbound

This paper cites Multilevel Monte Carlo methods for the Grad-Shafranov free boundary problem.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Multilevel Monte Carlo methods for the Grad-Shafranov free boundary problem

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-16T04:37:48.866605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.060617Z digest=sha256:25f927e06d5307554efbf808b8d7804c4785b1b9af508257e43c47e82fb41db3

Observation c3ce01d4-a0f0-4d49-a4aa-9f545825b134 · outbound

This paper cites The Capacity for Moral Self-Correction in Large Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models The Capacity for Moral Self-Correction in Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.063908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.063908Z digest=sha256:a40a24fc5cf95cccab9ff8d8b803d5b2d0db9ac5e8796f29c0997e956498cec3

Observation ff8a65c5-ac07-4019-892f-4651bd01aa9f · outbound

This paper cites Riemann zeros as quantized energies of scattering with impurities.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Riemann zeros as quantized energies of scattering with impurities

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.067564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.067564Z digest=sha256:bebd02d5510fc53f2501ebe76f0022e79bb0217d063b7e41c296a91170f640ca

Observation fbe04f05-0b35-4eab-9877-920862410467 · outbound

This paper cites Cushman, L.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Cushman, L

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.070877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.070877Z digest=sha256:b43d024f6a1ee8ca4bbf8571c7c6285af191a3fcdb5eb268d846d4a6452e6457

Observation 3f5efe67-782d-4c47-88c2-e5d64e1725fc · outbound

This paper cites Measuring moral reasoning using moral dilemmas: Evaluating reliability, validity, and differential item functioning of the behavioral defining issues test.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Measuring moral reasoning using moral dilemmas: Evaluating reliability, validity, and differential item functioning of the behavioral defining issues test

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.074168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.074168Z digest=sha256:63711d0dd16fed7dbb2a031cddabf2e3d1b12163a255c19c174135958a1cbbcc

Observation 6511a4fa-b9de-48a8-898f-b062c1dbb8a5 · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.077379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.077379Z digest=sha256:114a288556878ef9b32e150875cd56d9aa20441979a6fd71bedbf186c6806181

Observation 533b32d2-b020-4233-9709-8cef4cd8c246 · outbound

This paper cites Moral stories: Situated reasoning about norms, intents, actions, and their consequences.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Moral stories: Situated reasoning about norms, intents, actions, and their consequences

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.080497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.080497Z digest=sha256:978ccb199f4de73f73606464fb93cc427fe756b1100ccafb968a7db5b28e2328

Observation b72cfea8-63cf-4c5a-b28a-9b014fa010e1 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.083596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.083596Z digest=sha256:ecbef30ed098e003763839f71c2da122c72dac6b9420e525ca4f5651fce3fd5d

Observation 73bac660-f208-4fa2-9954-72cb7820f76d · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.086735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.086735Z digest=sha256:78b6cdf1e1d8e6b24f52237823727802e6d930537960cc231e4eaef540d39867

Observation 2e4c9626-53e1-466e-9dfc-705b78ae9b6e · outbound

This paper cites Artificial intelligence, values, and alignment.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Artificial intelligence, values, and alignment

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.090568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.090568Z digest=sha256:819e34a80a51c04128b893b77bb7f3978f0df37ca8451a495347b6d5a8b547e6

Observation 0726ad03-bb68-4dcb-9d90-746e603489f5 · outbound

This paper cites Graham et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Graham et al

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.094069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.094069Z digest=sha256:618d2a31377fc1357758aee648c1d9bf4181631ac81cf64260f2fbcac923f7ba

Observation c836b624-13d1-41e2-831c-50bd125033f2 · outbound

This paper cites Moral foundations theory: The pragmatic validity of moral pluralism.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Moral foundations theory: The pragmatic validity of moral pluralism

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.097437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.097437Z digest=sha256:d1fbe65b4fbcf7fcafe4cd62031ebe7ed0451c4905697d970cc7dba8dac6afdc

Observation 098676a3-013e-48f4-aada-ed53d5e26154 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.101605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.101605Z digest=sha256:b2e200c0d21fdcac77e493ba582097b92909fb30f1c638dff1a3ced0201e5622

Observation 01cb48e1-0928-4d3d-8b52-2016c8516188 · outbound

This paper cites Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.105412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.105412Z digest=sha256:a8ffe8915186a4a5cde89a6b181273afbd9ba48c84b79e04b0395485998fd414

Observation 02afc3a2-542a-466e-bdb8-70c2d3d87f0f · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.109063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.109063Z digest=sha256:456bc45bd63c94f5253db380abc762d756e1a40e9c1542ed6ce23066f1cba835

Observation 6266c894-4743-490a-b9a5-4a6585923a12 · outbound

This paper cites The Righteous Mind: Why Good People are Divided by Politics and Religion.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models The Righteous Mind: Why Good People are Divided by Politics and Religion

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.112243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.112243Z digest=sha256:5c1e9d38e7c518e2c839f74e2e5e48db8aab9198d3e3afc8fe631ca0d2c3bb6e

Observation c36c26a7-45e0-4d81-9cb7-240eece5624d · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Measuring Coding Challenge Competence With APPS

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.115646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.115646Z digest=sha256:3daf83e7509f1deb111872989d2e22d625d29210c449e3d7acd952bd6da2c846

Observation a4f5925d-3d2b-4252-9685-28a8b9d86a39 · outbound

This paper cites CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.119108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.119108Z digest=sha256:b4488adda5d21b0759a814b5e74e4228355b3c0b4cd7019ca1d68b4115cd7006

Observation 1f06c92c-fec1-4f39-9219-3ebcf71346e7 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.122442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.122442Z digest=sha256:ed3b9562ce28e87d4d9c4d257700ab5f72ef8d535d56288fa6f5a915aba3127e

Observation fed98156-d790-46c7-8630-b4163b6b2bbc · outbound

This paper cites Enabling AI and Robotic Coaches for Physical Rehabilitation Therapy: Iterative Design and Evaluation with Therapists and Post-Stroke Survivors.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Enabling AI and Robotic Coaches for Physical Rehabilitation Therapy: Iterative Design and Evaluation with Therapists and Post-Stroke Survivors

Reference 33

Resolution
metadata mismatch
local_arxiv, observed 2026-08-16T04:37:48.755663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.125556Z digest=sha256:cd555e23396229221addfab936fa2470e56f1a00c1f4bd7d5e6ea1fcdc76cad9

Observation 8c0477a4-6906-4a3a-8d92-e6ec1002c353 · outbound

This paper cites Hendrycks et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Hendrycks et al

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.129342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.129342Z digest=sha256:cd54532b663b47e1a14cada9591ac1c1a2217cc91626cdea46890c3825b6c0da

Observation ea736948-100c-45d0-a08b-7535d3f49880 · outbound

This paper cites The weirdest people in the world? Behavioral and Brain Sciences, 33(2-3):61–83, 2010.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models The weirdest people in the world? Behavioral and Brain Sciences, 33(2-3):61–83, 2010

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.343511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.132912Z digest=sha256:c875847a9a5c5833e07c4b4a554650f1e639d549fe8411e68aab8a1c0de97b9d

Observation f6ef4932-75e2-4c53-be49-70c6f4e1b198 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:49.331092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.136362Z digest=sha256:a4fd29fe4ad9fffd5b546208e7bd8cac7aabb77575aa1169b8108524a846eea0

Observation c149fe60-142b-4e31-ac93-bcc51efc8880 · outbound

This paper cites How is ChatGPT's behavior changing over time?.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models How is ChatGPT's behavior changing over time?

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.140359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.140359Z digest=sha256:d307de9ebeda43f3a4108f43f11494ce4655d009b7ae807b6c247a1c78a62631

Observation de0a7373-c8b3-483c-b8c9-81ff3124b6ec · outbound

This paper cites C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.144853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.144853Z digest=sha256:d1bda4d805ecf27e2b7dc88ff4631840ed9813228b82219d8f1052f599aefbb1

Observation aa1422d1-c818-4fce-a643-5ffd0aa6bcc1 · outbound

This paper cites TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.148677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.148677Z digest=sha256:85b06b836ce5b6637e18da8689e0d3e23ce28ec90a0b855daa840bd642a4c2bf

Observation 9b61b6e1-4608-40de-8070-36129ac87abb · outbound

This paper cites Open-source large language models leaderboard, 2023.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Open-source large language models leaderboard, 2023

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.319992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.153508Z digest=sha256:715dfe2e47996b7fc8a3bc7b1a16d9bcbecaf3632c6014052acca09eac7c4d48

Observation 6f228f24-5b15-4b50-98c4-d83ca23229ee · outbound

This paper cites Inter-university Consortium for Political and Social Research, 2000.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Inter-university Consortium for Political and Social Research, 2000

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.308539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.157513Z digest=sha256:5e995913f41a66304774fddabf67d1461dbb13103a8371897cc31712b68d940a

Observation 779e205a-5f34-4e2f-8490-66f81d3d8aa7 · outbound

This paper cites The global landscape of ai ethics guidelines.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models The global landscape of ai ethics guidelines

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.161867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.161867Z digest=sha256:7a8fc1021157c9f828caf85f260f046b8cb2a899953ca817b586d6e9c839027f

Observation aff18a76-6013-49d0-8e61-17e93ba07729 · outbound

This paper cites Ethics-eval: A bench- marking framework for ethical evaluation of language models, 2023.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Ethics-eval: A bench- marking framework for ethical evaluation of language models, 2023

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.289105Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.165905Z digest=sha256:906d6ace598a066b80b5618ff519a56578968e45716a3af6c10051891b658d28

Observation 686607ef-bf30-4bfe-91bf-592091b939a4 · outbound

This paper cites Dynabench: Rethinking Benchmarking in NLP.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Dynabench: Rethinking Benchmarking in NLP

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.170027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.170027Z digest=sha256:c5d0a12e1e6cc3a4f84e02ac230c18dcbcf228f07dfbd3c323d4d325edf7a467

Observation b3835249-db1e-4bda-a818-3b74ad07c320 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:49.277886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.174096Z digest=sha256:f386979aa8c75f7d7c25e51f0cf5e537f2f2dbc014f2d3a26eeea26eecdba911

Observation 477874a3-d18c-468b-9945-4903d1be3d4e · outbound

This paper cites Kohlberg.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Kohlberg

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.266611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.177630Z digest=sha256:cfc1e88ebd60a84d3678e66978c027695825f961781281f61666e31f37cd0ade

Observation 7d174c96-e70d-4611-8792-b58661a97943 · outbound

This paper cites Koncel-Kedziorski et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Koncel-Kedziorski et al

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.256071Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.181852Z digest=sha256:821869d8c3bc1da2681e3987d4405802e499b4740b284be9a5fea92476a2632b

Observation cfb384ba-44b2-4c07-a19a-0f61bd8b4ed1 · outbound

This paper cites Gender, race, and intersectionality on the federal appellate bench.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Gender, race, and intersectionality on the federal appellate bench

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.245551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.186211Z digest=sha256:f5904aba3df8c7c59f2725e972a5e27417ea11656e28e89068d05684d71629e4

Observation 9c90775c-b985-44a7-bf2a-15cfa4df7bce · outbound

This paper cites SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.190037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.190037Z digest=sha256:c8b244ef3fc51ea077a626e40af574a2fd22c9353bfd53c624c1f5898823ff30

Observation e6a3457d-525c-49bf-a094-d2f542d79b25 · outbound

This paper cites FullSubNet+: Channel Attention FullSubNet with Complex Spectrograms for Speech Enhancement.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models FullSubNet+: Channel Attention FullSubNet with Complex Spectrograms for Speech Enhancement

Reference 50

Resolution
metadata mismatch
local_arxiv, observed 2026-08-16T04:37:48.679151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.194354Z digest=sha256:fe143a57af8f5c797df3faa2472c1368f7222d9fbbedac59d5945a849fc56fad

Observation e45a61a7-c140-43db-aaed-07d13c08ffa0 · outbound

This paper cites Logic-guided semantic representation learning for zero-shot rela- tion classification.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Logic-guided semantic representation learning for zero-shot rela- tion classification

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.235138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.198266Z digest=sha256:6b81b418b7d64496aea458b759037198b8357466412fed4c7bbe468930124bd1

Observation 831e7284-0cf6-45ee-9524-d6c5dd07aa13 · outbound

This paper cites Holistic Evaluation of Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Holistic Evaluation of Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.205650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.205650Z digest=sha256:cb62f3dfda83d80de87f44735c9497c0f7e226462a4294d626e88f324072972c

Observation 1a65f7fe-3482-462c-9597-77996dcf39b8 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:49.222196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.209848Z digest=sha256:83c9c678afe304fe6d4947572399a49f8176c7d209ee454e6bedc711089ee703

Observation d00db2f8-e117-4ee5-919b-2ecb525999c9 · outbound

This paper cites Ling et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Ling et al

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.210050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.214027Z digest=sha256:6605daef035276272f4bf8d684d72b8558df6d3a3172590ffebb8d0540bdbe4b

Observation db7db0de-16e4-4d49-baeb-e5e6ac23a2cd · outbound

This paper cites MMBench: Is Your Multi-modal Model an All-around Player?.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models MMBench: Is Your Multi-modal Model an All-around Player?

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.217632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.217632Z digest=sha256:28f01a397ce4724ad79ce5e7ec3a4c3ffdba16b075ccca2f26133ce5b9fd58e1

Observation a6a2dfa2-6efa-46c1-a759-b9085bd354d5 · outbound

This paper cites Multi-task deep neural networks for natural language understanding.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Multi-task deep neural networks for natural language understanding

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.199025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.222157Z digest=sha256:901abdeacc2bec58b875937280db1eff23f17c94e8214b4e3d7cd9820461b5a9

Observation b8913c74-bd33-4f88-a351-180100d1b3f1 · outbound

This paper cites Chatbot arena: Benchmarking llms in the wild with elo ratings, 2023.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Chatbot arena: Benchmarking llms in the wild with elo ratings, 2023

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.187474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.226185Z digest=sha256:1e6ae7ce57cf97370e2cf6cfd9045d9f91fff2a4bdd43a51c962e21763812b2f

Observation 616b497a-4e7b-427e-ba58-e5dc2d1649de · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:49.176507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.229949Z digest=sha256:a11f0a1cc91b3eddaf60c8eba95edf81ba22286fa0621eda1f8aa4f65059bda0

Observation c3978adb-d0a4-477d-b7ba-82ec23122cea · outbound

This paper cites Algo- rithmic fairness: Choices, assumptions, and definitions.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Algo- rithmic fairness: Choices, assumptions, and definitions

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.165203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.233885Z digest=sha256:572b646331f57d735f5215f7dbf236bf217e7a5b09d64e902b75581c10ac858f

Observation 6679eebf-8522-42c8-ac87-438bc58d6aac · outbound

This paper cites Principles alone cannot guarantee ethical ai.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Principles alone cannot guarantee ethical ai

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.152631Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.237789Z digest=sha256:f58f30bb0c8b5695e0870155635d5e33adfd69e03be825a142ab89f15d4284aa

Observation 3b58ee3a-10f7-4a3b-bd75-2a7070fbed13 · outbound

This paper cites Interpretable machine learning.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Interpretable machine learning

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.140807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.241651Z digest=sha256:a2c6361fc98857944cc1ae86e9e33b578b00226f3e339ea4ed265b1022daa688

Observation a45c478c-cd8c-4499-a8f7-428a6c32bfab · outbound

This paper cites Translation tutorial: 21 fairness definitions and their politics.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Translation tutorial: 21 fairness definitions and their politics

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.126410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.245596Z digest=sha256:035ae2f71a1e0f89d813a15bb115c4a779ff847f439d3bc6c5a9037998ec57f6

Observation 53fa1282-63cf-4f41-b042-16046629838f · outbound

This paper cites trolley problem.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models trolley problem

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.114356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.250980Z digest=sha256:70acca5b6521130d6868c41f1bf8f0571e2b093b056779c68989e2776a39976e

Observation ece19c91-c7d0-4f29-9527-ed7806ad51d0 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 65

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:49.102674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.255343Z digest=sha256:22420626a19606e1bc839ee55060384d3c46930123dbf7181e5c1bffc8af7ea3

Observation 142dd244-394c-493f-91d0-3666184a42ff · outbound

This paper cites GPT-4 Technical Report.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models GPT-4 Technical Report

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.259484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.259484Z digest=sha256:73e07b9fde0564c2d4f9e94c9670310311d6e0d221d017539bfca6aa6ad932e6

Observation 2f629139-ab87-49f5-98d7-cba9cead5372 · outbound

This paper cites Paolacci, J.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Paolacci, J

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.091343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.262982Z digest=sha256:964dd9ca83093ced1443904c19031414e1e92976d577d5d02db1d24ac6489ef4

Observation 3b6d4b33-e1d3-4f61-af8f-f5be3603b769 · outbound

This paper cites Scaling Language Models: Methods, Analysis & Insights from Training Gopher.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Scaling Language Models: Methods, Analysis & Insights from Training Gopher

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.266435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.266435Z digest=sha256:4c27b932bfb3e400cf447bb14e63fdb7adf371692b9935362de64c61e7e38ff7

Observation c70c94b0-5cec-4c2f-bb9e-4e2b35ab98b0 · outbound

This paper cites Closing the ai accountability gap: Defining an end-to-end framework for internal algorithmic auditing.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Closing the ai accountability gap: Defining an end-to-end framework for internal algorithmic auditing

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.080431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.270520Z digest=sha256:84a67ea8565add50e67045f6241a9f58a1d70ecc081038256053ef149a0c83cf

Observation 7b478798-fa0a-43a8-bb76-850d9afa1714 · outbound

This paper cites Sentence-bert: Sentence embeddings using siamese bert- networks.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Sentence-bert: Sentence embeddings using siamese bert- networks

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.273983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.273983Z digest=sha256:be9ed2105ba06a21666b98b375ffe8d52eef061a337d2ffc6a3a6abd3a7e9569

Observation 55ea9473-b12c-4899-8082-2e6c2479fe9f · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 71

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:49.062330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.277579Z digest=sha256:6f08826d82266d5a8a73f510ff8b122fe6b15ed96d3e4bc21b85c08f0e741a81

Observation 383f21b7-2b5b-4647-8f12-4142035255c9 · outbound

This paper cites Adaptive testing and debugging of nlp models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Adaptive testing and debugging of nlp models

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.051321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.281173Z digest=sha256:d104920b7ab383a7e3c807ed2cb709935f06769cbd192997b4ddff275c5bb0ce

Observation 7477c323-1a21-42d5-bdf0-0b3867be9515 · outbound

This paper cites Rudinger et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Rudinger et al

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.039533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.284555Z digest=sha256:6235e64f1ae6a48ea00780b5ddec4937a129c77c40fcf8bda5637b563e2b8aa8

Observation 2aa00da1-5605-4f60-8d02-674d51bb3826 · outbound

This paper cites Sap et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Sap et al

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.027351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.288407Z digest=sha256:6cd71af27d18b0a496074081aa7fef1dc8b38f8cdd9ac9a120eafe76d235ba92

Observation 7ba73739-2ff6-4ecc-b0c0-b0707bfaded1 · outbound

This paper cites big three.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models big three

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.015772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.292151Z digest=sha256:33a57e9e69d6ead15eee0f32519620ea478e7a039632b4209d86899e1e0ac2e8

Observation 69269a41-cb9b-4dec-b4b3-51b85c4e96d0 · outbound

This paper cites Singhal et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Singhal et al

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:49.003834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.295938Z digest=sha256:633277a46bcfb9896b08e342dc61cd9183186c9f9faf32ba7364cd22876146f7

Observation 80cb5ae2-09d4-48d9-a794-d76c3b7cf2d6 · outbound

This paper cites Open-source tools learning benchmarks, 2023.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Open-source tools learning benchmarks, 2023

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:48.992551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.299533Z digest=sha256:bd4771886f140862cd7c8a19db58eb3a2bafb5fe69de0c5d5b24e5789a6c819b

Observation 981f48d9-e247-4ee5-a2dd-25cbf38a9821 · outbound

This paper cites High-performance medicine: the convergence of human and artificial intelligence.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models High-performance medicine: the convergence of human and artificial intelligence

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.303111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.303111Z digest=sha256:cfee053f554a185ed876444ac2a0a551794b5f97e3a48368bb253d7347438200

Observation 86028ba9-313d-4213-93d7-85af4d116abe · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.306679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.306679Z digest=sha256:1da53352176727c07630e6ea132e468777544a886b2873f315dfeb66a7c89127

Observation b85ee886-52c3-46e8-bdc3-1d8ae7a2f650 · outbound

This paper cites RoBERTweet: A BERT Language Model for Romanian Tweets.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models RoBERTweet: A BERT Language Model for Romanian Tweets

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-16T04:37:48.608348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.310229Z digest=sha256:6cf0f1d69765ef8bda789832345dac6a7e7ba658f1dc335541a0c8cb6198ec9f

Observation 46193ff2-c3e1-4232-bb14-30529a1e51b5 · outbound

This paper cites OntoChatGPT Information System: Ontology-Driven Structured Prompts for ChatGPT Meta-Learning.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models OntoChatGPT Information System: Ontology-Driven Structured Prompts for ChatGPT Meta-Learning

Reference 81

Resolution
verified exact
local_arxiv, observed 2026-08-16T04:37:48.593268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.314185Z digest=sha256:ede42ea3a1fbad30859cedf12d316e0bf14c46f7c33993afd0bf3f07077b1283

Observation a6bb601f-3bbf-48fc-8d1b-3b12079d8c9a · outbound

This paper cites Neuro-symbolic Empowered Denoising Diffusion Probabilistic Models for Real-time Anomaly Detection in Industry 4.0.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Neuro-symbolic Empowered Denoising Diffusion Probabilistic Models for Real-time Anomaly Detection in Industry 4.0

Reference 82

Resolution
verified exact
local_arxiv, observed 2026-08-16T04:37:48.577479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.318191Z digest=sha256:1e5c6b40037425cfd4bcb6b9c8d6b1ac7e75d45f82b9223bcc0f3084622881ca

Observation 88605bc5-37d3-4b52-a56c-fa08226812eb · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.321759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.321759Z digest=sha256:4733ef19e3a444c15008f3cf384f52da917988a447ca315c12e34bafd3685dff

Observation 86101bca-74bb-4827-98d6-7e582f646538 · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.325272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.325272Z digest=sha256:2ce650ccb181a95f35bdf310dd498131277a8f28fbaffd39884438e93030c0e8

Observation ce4c9d8b-e2cd-45c1-a628-514a3878dad4 · outbound

This paper cites Taxonomy of risks posed by language models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Taxonomy of risks posed by language models

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:48.971633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.328791Z digest=sha256:a5ce9cf4a0b49bab660a9a277de37f2e1156d9b29dd7c2aecefa632e8bb324d2

Observation 964b971e-65c4-481f-9efc-fe8047da056e · outbound

This paper cites The role and limits of principles in ai ethics: towards a focus on tensions.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models The role and limits of principles in ai ethics: towards a focus on tensions

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:48.959838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.332335Z digest=sha256:84b7d334370cd0a1cf047c6e799d13981e0817de18038b9c5270ab563663dfdc

Observation f4ba6393-c4c0-4c73-9d30-d7cd4d07eb82 · outbound

This paper cites Transformers: State- of-the-art natural language processing.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Transformers: State- of-the-art natural language processing

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:48.947716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.335926Z digest=sha256:31221c08d79fb1baf1adf646ac68301ebd38616d00c6dd15e10bac6b8d338fa4

Observation aa9dca84-ffc0-4444-acd3-c68c91ed0ad3 · outbound

This paper cites CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.339825Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.339825Z digest=sha256:149d43601294927ec2ade706511e1ad77d4d563f30da4bffbd297ee2deeaa586

Observation 191847ee-4d65-463a-88c4-f1161a1b1f10 · outbound

This paper cites LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.343494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.343494Z digest=sha256:3c545fb5b6e30829359c669c02d9a436834b85f521139b94fda1e10dda7e95b9

Observation 279fea2c-e9de-4ef9-884f-ffd73af4f865 · outbound

This paper cites GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.347641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.347641Z digest=sha256:82fc233433e882f709c720125ac7ec49aca8d07bd4042511752f03c512488969

Observation f5792766-c14b-4fac-81cb-31b3dd1f8ac2 · outbound

This paper cites Kosmos-2: Grounding Multimodal Large Language Models to the World.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Kosmos-2: Grounding Multimodal Large Language Models to the World

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.351258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.351258Z digest=sha256:68f326ba09ee3f7afaceef8706a66a5452775234f3c9b98980885128506fbf2f

Observation 99624c16-5789-4d07-b095-041830f90515 · outbound

This paper cites LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.355011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.355011Z digest=sha256:bfda596b704d401daef90a72fd255324266bc9506d4972201878dbaebdf01508

Observation 802b8577-1e88-4fd8-9f10-4a304aa202e5 · outbound

This paper cites MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.358809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.358809Z digest=sha256:33fb8f18e31fb293fa12a6b5a4c67cf98263479b508652194e23faf9758cba85

Observation 83a5518d-8949-4ec1-9a06-6176c4497ef9 · outbound

This paper cites Young et al.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Young et al

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:37:48.935195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.362651Z digest=sha256:3c82c532f4bdef5ed8cb573c700039dcafb4a54edd83e7685a870b446bbdde26

Observation 5253eb86-bf16-4c6e-991a-f285dfb20531 · outbound

This paper cites KoLA: Carefully Benchmarking World Knowledge of Large Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models KoLA: Carefully Benchmarking World Knowledge of Large Language Models

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.366110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.366110Z digest=sha256:9d4790d1c4d580a95e47d51f5eacea4face62d81778f14d62fbdeda86806b65f

Observation 61c6553d-e5a2-4d3a-b8af-d5bd4296f226 · outbound

This paper cites an unresolved cited work.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Unresolved cited work

Reference 96

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:37:48.923839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:37:48.369629Z digest=sha256:a54c66563ec851d01b7e5ed37da2acb1a27412a852903ff3e1cbce89f5ece378

Observation 5c8f6f66-3df2-4c73-b06c-b9c0b0d1ae7e · outbound

This paper cites M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.372907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.372907Z digest=sha256:c98877de08a03126de9f991b50699e36e8cfb872bbaf4123780b7643b47116cc

Observation 82e1f6db-97a6-4fc6-a326-483874931705 · outbound

This paper cites Calibrate Before Use: Improving Few-Shot Performance of Language Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Calibrate Before Use: Improving Few-Shot Performance of Language Models

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.376928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.376928Z digest=sha256:351545de9c2dfeca1bb432513c638afd7f1fcd951e8300dd0fa2012591ebb9a0

Observation d2248598-2530-459f-a0d1-92e4c608773f · outbound

This paper cites Link Prediction without Graph Neural Networks.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models Link Prediction without Graph Neural Networks

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.380613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.380613Z digest=sha256:0b2f29d30cd0277ec89693fbf238c30ce93eeb3783412f56215ce0e0ccbc4212

Observation f1ebe5d4-d1d6-4bed-81cb-46131d2f3664 · outbound

This paper cites AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.384477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.384477Z digest=sha256:0e60de9ec9a36c6f65d5eb20466fd9f842ed1b5f3f83e8347d4cbd8979f7c0f2

Observation b92028cd-1ee1-430a-a541-34bfd3e9fd0b · outbound

This paper cites PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts.

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts

Reference 101

Resolution
unresolved
no resolver link, observed 2026-08-16T04:37:48.388254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:37:48.388254Z digest=sha256:592753bd0a3ab307d08c95c274c492b45dbb9d96423f9c1b0961a2457c13be05

Pith citing papers

Observation 88f54591-d652-48b5-b21f-d120401c1208 · inbound

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values cites this paper.

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

Reference 108

Resolution
verified exact
arxiv_id, observed 2026-05-12T04:31:21.340914Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-12T04:22:06.172150Z digest=sha256:26cf8c58dce40f19e5bbd8159b8cdda8a57e2cc7a1032edc8b282a9f14c600aa