{"as_of":"2026-08-23T00:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d21a5b2fb129c1042bff0e50b7ffbe959e5adb51dbe295bba5ba10767476bb58","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:37:48.388254Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:22:06.172150Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.00853","doi":"10.48550/arxiv.2505.00853","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM ethics benchmark: A three-dimensional assessment system for eval- uating moral reasoning in large language models.CoRR, abs/2505.00853","venue":"ArXiv.org","work_id":"20a1d998-e2b8-4249-b6b2-2a61e476e618","year":2025},"citing_paper":{"arxiv_id":"2605.10365","last_updated":"2026-05-11T11:09:04Z","snapshot_observed_at":"2026-08-13T21:27:08.239682Z","submitted_at":"2026-05-11T11:09:04Z","title":"Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:06.172150Z"},"links":{"cited_paper":"/paper/2505.00853","citing_paper":"/paper/2605.10365"},"observation_digest":"sha256:26cf8c58dce40f19e5bbd8159b8cdda8a57e2cc7a1032edc8b282a9f14c600aa","observation_id":"88f54591-d652-48b5-b21f-d120401c1208","resolution":{"observed_at":"2026-05-12T04:31:21.340914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00853/citation-record","integrity":"/paper/2505.00853/integrity","json":"/paper/2505.00853/citation-record.json","paper":"/paper/2505.00853"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T04:37:48.007229Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.007229Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:d792c97b4113a9bd08ac2806a9eeee37158818772783f90966086dd3b7d431b9","observation_id":"399266f9-3a7d-45cd-948d-614047817435","resolution":{"observed_at":"2026-08-16T04:37:48.007229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01681","last_updated":"2022-12-03T20:18:16Z","snapshot_observed_at":"2026-08-22T11:31:18.139330Z","submitted_at":"2022-12-03T20:18:16Z","title":"Language Models as Agent Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.01681","snapshot_observed_at":"2026-08-16T04:37:48.012655Z","title":"Language models as agent models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.012655Z"},"links":{"cited_paper":"/paper/2212.01681","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:f37b7f88bee2da9bafe04cd4b768def125c646846204244734cbd4ed908856cc","observation_id":"87a759c4-0df4-4622-9955-5f1e1028daad","resolution":{"observed_at":"2026-08-16T04:37:48.012655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.017733Z","title":"Claude: A conversational ai assistant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.017733Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:4a005ce13ea1752f78131c797b2a925946cf694c375466a3d08d65b6c8d29041","observation_id":"65d16a69-256e-430d-a598-18b95615c575","resolution":{"observed_at":"2026-08-16T04:37:48.017733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.021922Z","title":"Aquino and A","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.021922Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:ef7d277693d8891e3dcdeb99facd7bfec984ed1be01e3d61e2762a78c00ddf1e","observation_id":"226c38bb-b7cf-4314-b128-74ae045d219d","resolution":{"observed_at":"2026-08-16T04:37:48.021922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.025997Z","title":"Probing pre- trained language models for cross-cultural differences in values","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.025997Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:9f44616997071e14451c0992f4189d3f10b7b0290dd5ea76bac989002cf594b6","observation_id":"5e89fa7b-23d4-4a70-af01-9e1eef746caa","resolution":{"observed_at":"2026-08-16T04:37:48.025997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.030508Z","title":"Awad et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.030508Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:228d8069e30268bda1d799f6a3d91fd8fc85b865cfaf2f7ebc054566478281b9","observation_id":"618f7f45-c46e-40d5-a34c-59cdae90624f","resolution":{"observed_at":"2026-08-16T04:37:48.030508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.034769Z","title":"Bandura et al","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.034769Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:394a5a5a4f1854373fb71f681d1463b411d19af79e87bf08dad0f726244e0af4","observation_id":"e7a16ad1-da38-467e-846b-3f9a2dc65cb1","resolution":{"observed_at":"2026-08-16T04:37:48.034769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.038662Z","title":"Bender, Timnit Gebru, Angelina McMillan-Major, and Shmargaret Shmitchell","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.038662Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:63be778e3550809043ac5a00474c7a1ba2403254c1e5aff877a5bf6f8b3abf08","observation_id":"95217eeb-8146-4b2b-97c0-ad4c5642701d","resolution":{"observed_at":"2026-08-16T04:37:48.038662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-16T04:37:48.042311Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.042311Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:c1ff1076cc4a5f6c315227bca561c866877e78ee44f0804c125f5bb03a99f473","observation_id":"98db0cb4-1696-4ddf-9587-928307ef7930","resolution":{"observed_at":"2026-08-16T04:37:48.042311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.046294Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.046294Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6d2b4030099ed3f585e4881ba30ca3579175eedb3075d9acc17da5a8410e23bd","observation_id":"89e09f19-12a8-421e-96f0-ad952c2cc50f","resolution":{"observed_at":"2026-08-16T04:37:48.046294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.049762Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.049762Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:ba1bcaff69ae8e0a48b1f77f3c37624790f8ffbfb5a2f2018a0613dfce1263a4","observation_id":"3458cb0b-d5b5-4251-bc86-7aa3ede1a61d","resolution":{"observed_at":"2026-08-16T04:37:48.049762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-16T04:37:48.053037Z","title":"Cultural alignment of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.053037Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:dd83ce6976780df8b9bf450a2d265b25863376aa5fe65461369bb5f9aa194581","observation_id":"9dc6a800-24de-4508-9d68-1cfd0e5de0d9","resolution":{"observed_at":"2026-08-16T04:37:48.053037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.057165Z","title":"Chalkidis et al","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.057165Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:53deff7339a4d77aaacade3087e42cdca67e70bd12b1234c3190456c7cefd9cb","observation_id":"c64fe085-af89-40b0-80cc-12065c02b274","resolution":{"observed_at":"2026-08-16T04:37:48.057165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13249","last_updated":"2023-12-21T08:20:14Z","snapshot_observed_at":"2026-08-16T15:21:47.742988Z","submitted_at":"2023-06-23T00:21:49Z","title":"Multilevel Monte Carlo methods for the Grad-Shafranov free boundary problem","version":2},"cited_work":{"arxiv_id":"2306.13249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.13249","snapshot_observed_at":"2026-08-16T04:37:48.862074Z","title":"Multilevel Monte Carlo methods for the Grad-Shafranov free boundary problem","venue":"physics.comp-ph","work_id":"dc882128-358c-4d9f-9ca7-edd12cee5caa","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.060617Z"},"links":{"cited_paper":"/paper/2306.13249","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:25f927e06d5307554efbf808b8d7804c4785b1b9af508257e43c47e82fb41db3","observation_id":"f73bd80d-f6ff-4030-8496-6ec0b32b7d25","resolution":{"observed_at":"2026-08-16T04:37:48.866605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-16T04:37:48.063908Z","title":"On the role of reasoning in moral alignment of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.063908Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a40a24fc5cf95cccab9ff8d8b803d5b2d0db9ac5e8796f29c0997e956498cec3","observation_id":"c3ce01d4-a0f0-4d49-a4aa-9f545825b134","resolution":{"observed_at":"2026-08-16T04:37:48.063908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01254","last_updated":"2024-04-15T12:17:50Z","snapshot_observed_at":"2026-08-16T15:19:03.729576Z","submitted_at":"2023-07-03T18:00:01Z","title":"Riemann zeros as quantized energies of scattering with impurities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01254","snapshot_observed_at":"2026-08-16T04:37:48.067564Z","title":"Multimodal-coda: A dataset for contrastive disambiguation analysis in multimodal reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.067564Z"},"links":{"cited_paper":"/paper/2307.01254","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:bebd02d5510fc53f2501ebe76f0022e79bb0217d063b7e41c296a91170f640ca","observation_id":"ff8a65c5-ac07-4019-892f-4651bd01aa9f","resolution":{"observed_at":"2026-08-16T04:37:48.067564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.070877Z","title":"Cushman, L","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.070877Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:b43d024f6a1ee8ca4bbf8571c7c6285af191a3fcdb5eb268d846d4a6452e6457","observation_id":"fbe04f05-0b35-4eab-9877-920862410467","resolution":{"observed_at":"2026-08-16T04:37:48.070877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.074168Z","title":"Measuring moral reasoning using moral dilemmas: Evaluating reliability, validity, and differential item functioning of the behavioral defining issues test","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.074168Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:63711d0dd16fed7dbb2a031cddabf2e3d1b12163a255c19c174135958a1cbbcc","observation_id":"3f5efe67-782d-4c47-88c2-e5d64e1725fc","resolution":{"observed_at":"2026-08-16T04:37:48.074168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:37:48.077379Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.077379Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:114a288556878ef9b32e150875cd56d9aa20441979a6fd71bedbf186c6806181","observation_id":"6511a4fa-b9de-48a8-898f-b062c1dbb8a5","resolution":{"observed_at":"2026-08-16T04:37:48.077379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.080497Z","title":"Moral stories: Situated reasoning about norms, intents, actions, and their consequences","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.080497Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:978ccb199f4de73f73606464fb93cc427fe756b1100ccafb968a7db5b28e2328","observation_id":"533b32d2-b020-4233-9709-8cef4cd8c246","resolution":{"observed_at":"2026-08-16T04:37:48.080497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.083596Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.083596Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:ecbef30ed098e003763839f71c2da122c72dac6b9420e525ca4f5651fce3fd5d","observation_id":"b72cfea8-63cf-4c5a-b28a-9b014fa010e1","resolution":{"observed_at":"2026-08-16T04:37:48.083596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T04:37:48.086735Z","title":"Fu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.086735Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:78b6cdf1e1d8e6b24f52237823727802e6d930537960cc231e4eaef540d39867","observation_id":"73bac660-f208-4fa2-9954-72cb7820f76d","resolution":{"observed_at":"2026-08-16T04:37:48.086735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.090568Z","title":"Artificial intelligence, values, and alignment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.090568Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:819e34a80a51c04128b893b77bb7f3978f0df37ca8451a495347b6d5a8b547e6","observation_id":"2e4c9626-53e1-466e-9dfc-705b78ae9b6e","resolution":{"observed_at":"2026-08-16T04:37:48.090568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.094069Z","title":"Graham et al","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.094069Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:618d2a31377fc1357758aee648c1d9bf4181631ac81cf64260f2fbcac923f7ba","observation_id":"0726ad03-bb68-4dcb-9d90-746e603489f5","resolution":{"observed_at":"2026-08-16T04:37:48.094069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.097437Z","title":"Moral foundations theory: The pragmatic validity of moral pluralism","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.097437Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:d1fbe65b4fbcf7fcafe4cd62031ebe7ed0451c4905697d970cc7dba8dac6afdc","observation_id":"c836b624-13d1-41e2-831c-50bd125033f2","resolution":{"observed_at":"2026-08-16T04:37:48.097437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.101605Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.101605Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:b2e200c0d21fdcac77e493ba582097b92909fb30f1c638dff1a3ced0201e5622","observation_id":"098676a3-013e-48f4-aada-ed53d5e26154","resolution":{"observed_at":"2026-08-16T04:37:48.101605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05783","last_updated":"2024-03-11T09:49:04Z","snapshot_observed_at":"2026-08-16T15:25:13.507253Z","submitted_at":"2023-06-09T09:52:05Z","title":"Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05783","snapshot_observed_at":"2026-08-16T04:37:48.105412Z","title":"Guo et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.105412Z"},"links":{"cited_paper":"/paper/2306.05783","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a8ffe8915186a4a5cde89a6b181273afbd9ba48c84b79e04b0395485998fd414","observation_id":"01cb48e1-0928-4d3d-8b52-2016c8516188","resolution":{"observed_at":"2026-08-16T04:37:48.105412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.109063Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.109063Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:456bc45bd63c94f5253db380abc762d756e1a40e9c1542ed6ce23066f1cba835","observation_id":"02afc3a2-542a-466e-bdb8-70c2d3d87f0f","resolution":{"observed_at":"2026-08-16T04:37:48.109063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.112243Z","title":"The Righteous Mind: Why Good People are Divided by Politics and Religion","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.112243Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:5c1e9d38e7c518e2c839f74e2e5e48db8aab9198d3e3afc8fe631ca0d2c3bb6e","observation_id":"6266c894-4743-490a-b9a5-4a6585923a12","resolution":{"observed_at":"2026-08-16T04:37:48.112243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-16T04:37:48.115646Z","title":"Hendrycks et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.115646Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:3daf83e7509f1deb111872989d2e22d625d29210c449e3d7acd952bd6da2c846","observation_id":"c36c26a7-45e0-4d81-9cb7-240eece5624d","resolution":{"observed_at":"2026-08-16T04:37:48.115646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06268","last_updated":"2021-11-08T21:23:22Z","snapshot_observed_at":"2026-08-18T13:16:37.097091Z","submitted_at":"2021-03-10T18:59:34Z","title":"CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06268","snapshot_observed_at":"2026-08-16T04:37:48.119108Z","title":"Hendrycks et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.119108Z"},"links":{"cited_paper":"/paper/2103.06268","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:b4488adda5d21b0759a814b5e74e4228355b3c0b4cd7019ca1d68b4115cd7006","observation_id":"a4f5925d-3d2b-4252-9685-28a8b9d86a39","resolution":{"observed_at":"2026-08-16T04:37:48.119108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T04:37:48.122442Z","title":"Hendrycks et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.122442Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:ed3b9562ce28e87d4d9c4d257700ab5f72ef8d535d56288fa6f5a915aba3127e","observation_id":"1f06c92c-fec1-4f39-9219-3ebcf71346e7","resolution":{"observed_at":"2026-08-16T04:37:48.122442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08458","last_updated":"2023-01-01T04:08:27Z","snapshot_observed_at":"2026-08-16T18:16:52.013537Z","submitted_at":"2021-06-15T22:06:39Z","title":"Enabling AI and Robotic Coaches for Physical Rehabilitation Therapy: Iterative Design and Evaluation with Therapists and Post-Stroke Survivors","version":2},"cited_work":{"arxiv_id":"2106.08458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.08458","snapshot_observed_at":"2026-08-16T04:37:48.751317Z","title":"Enabling AI and Robotic Coaches for Physical Rehabilitation Therapy: Iterative Design and Evaluation with Therapists and Post-Stroke Survivors","venue":"cs.RO","work_id":"de5496db-456e-40ad-a1ba-fcf698f53139","year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.125556Z"},"links":{"cited_paper":"/paper/2106.08458","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:cd555e23396229221addfab936fa2470e56f1a00c1f4bd7d5e6ea1fcdc76cad9","observation_id":"fed98156-d790-46c7-8630-b4163b6b2bbc","resolution":{"observed_at":"2026-08-16T04:37:48.755663Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.129342Z","title":"Hendrycks et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.129342Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:cd54532b663b47e1a14cada9591ac1c1a2217cc91626cdea46890c3825b6c0da","observation_id":"8c0477a4-6906-4a3a-8d92-e6ec1002c353","resolution":{"observed_at":"2026-08-16T04:37:48.129342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.339500Z","title":"The weirdest people in the world? Behavioral and Brain Sciences, 33(2-3):61–83, 2010","venue":null,"work_id":"8081b096-6078-4ba5-a1eb-69eb71c4ffe3","year":2010},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.132912Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:c875847a9a5c5833e07c4b4a554650f1e639d549fe8411e68aab8a1c0de97b9d","observation_id":"ea736948-100c-45d0-a08b-7535d3f49880","resolution":{"observed_at":"2026-08-16T04:37:49.343511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.327500Z","title":null,"venue":null,"work_id":"fe7d21a3-d944-4413-b974-f782429b411f","year":2014},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.136362Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a4fd29fe4ad9fffd5b546208e7bd8cac7aabb77575aa1169b8108524a846eea0","observation_id":"f6ef4932-75e2-4c53-be49-70c6f4e1b198","resolution":{"observed_at":"2026-08-16T04:37:49.331092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09009","last_updated":"2023-10-31T16:13:44Z","snapshot_observed_at":"2026-08-16T15:15:27.509831Z","submitted_at":"2023-07-18T06:56:08Z","title":"How is ChatGPT's behavior changing over time?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09009","snapshot_observed_at":"2026-08-16T04:37:48.140359Z","title":"Huang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.140359Z"},"links":{"cited_paper":"/paper/2307.09009","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:d307de9ebeda43f3a4108f43f11494ce4655d009b7ae807b6c247a1c78a62631","observation_id":"c149fe60-142b-4e31-ac93-bcc51efc8880","resolution":{"observed_at":"2026-08-16T04:37:48.140359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-18T15:25:57.481597Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-16T04:37:48.144853Z","title":"Huang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.144853Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:d1bda4d805ecf27e2b7dc88ff4631840ed9813228b82219d8f1052f599aefbb1","observation_id":"de0a7373-c8b3-483c-b8c9-81ff3124b6ec","resolution":{"observed_at":"2026-08-16T04:37:48.144853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11507","last_updated":"2023-06-20T12:53:39Z","snapshot_observed_at":"2026-08-21T14:47:27.632573Z","submitted_at":"2023-06-20T12:53:39Z","title":"TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11507","snapshot_observed_at":"2026-08-16T04:37:48.148677Z","title":"Huang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.148677Z"},"links":{"cited_paper":"/paper/2306.11507","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:85b06b836ce5b6637e18da8689e0d3e23ce28ec90a0b855daa840bd642a4c2bf","observation_id":"aa1422d1-c818-4fce-a643-5ffd0aa6bcc1","resolution":{"observed_at":"2026-08-16T04:37:48.148677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.316059Z","title":"Open-source large language models leaderboard, 2023","venue":null,"work_id":"9d7ae0d3-4c8f-4b5c-bc0c-48ee51d0ca35","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.153508Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:715dfe2e47996b7fc8a3bc7b1a16d9bcbecaf3632c6014052acca09eac7c4d48","observation_id":"9b61b6e1-4608-40de-8070-36129ac87abb","resolution":{"observed_at":"2026-08-16T04:37:49.319992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.304275Z","title":"Inter-university Consortium for Political and Social Research, 2000","venue":null,"work_id":"fd28eeb0-f697-40c1-b67e-3af5d29d28e7","year":1981},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.157513Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:5e995913f41a66304774fddabf67d1461dbb13103a8371897cc31712b68d940a","observation_id":"6f228f24-5b15-4b50-98c4-d83ca23229ee","resolution":{"observed_at":"2026-08-16T04:37:49.308539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.161867Z","title":"The global landscape of ai ethics guidelines","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.161867Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:7a8fc1021157c9f828caf85f260f046b8cb2a899953ca817b586d6e9c839027f","observation_id":"779e205a-5f34-4e2f-8490-66f81d3d8aa7","resolution":{"observed_at":"2026-08-16T04:37:48.161867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.285119Z","title":"Ethics-eval: A bench- marking framework for ethical evaluation of language models, 2023","venue":null,"work_id":"7646dec0-14dd-412e-932d-9202b5565924","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.165905Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:906d6ace598a066b80b5618ff519a56578968e45716a3af6c10051891b658d28","observation_id":"aff18a76-6013-49d0-8e61-17e93ba07729","resolution":{"observed_at":"2026-08-16T04:37:49.289105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14337","last_updated":"2021-04-07T17:49:17Z","snapshot_observed_at":"2026-08-16T18:33:13.536437Z","submitted_at":"2021-04-07T17:49:17Z","title":"Dynabench: Rethinking Benchmarking in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14337","snapshot_observed_at":"2026-08-16T04:37:48.170027Z","title":"Kiela et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.170027Z"},"links":{"cited_paper":"/paper/2104.14337","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:c5d0a12e1e6cc3a4f84e02ac230c18dcbcf228f07dfbd3c323d4d325edf7a467","observation_id":"686607ef-bf30-4bfe-91bf-592091b939a4","resolution":{"observed_at":"2026-08-16T04:37:48.170027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.274274Z","title":null,"venue":null,"work_id":"9d19b334-c8e1-4142-98f5-be3a764520d4","year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.174096Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:f386979aa8c75f7d7c25e51f0cf5e537f2f2dbc014f2d3a26eeea26eecdba911","observation_id":"b3835249-db1e-4bda-a818-3b74ad07c320","resolution":{"observed_at":"2026-08-16T04:37:49.277886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.263043Z","title":"Kohlberg","venue":null,"work_id":"7dae9f5a-ce47-48b6-a876-d8334d7a4b9f","year":1981},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.177630Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:cfc1e88ebd60a84d3678e66978c027695825f961781281f61666e31f37cd0ade","observation_id":"477874a3-d18c-468b-9945-4903d1be3d4e","resolution":{"observed_at":"2026-08-16T04:37:49.266611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.252516Z","title":"Koncel-Kedziorski et al","venue":null,"work_id":"df3f02c9-6c46-4357-a640-9ce8dda8abb3","year":2015},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.181852Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:821869d8c3bc1da2681e3987d4405802e499b4740b284be9a5fea92476a2632b","observation_id":"7d174c96-e70d-4611-8792-b58661a97943","resolution":{"observed_at":"2026-08-16T04:37:49.256071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.241931Z","title":"Gender, race, and intersectionality on the federal appellate bench","venue":null,"work_id":"60db4fd2-f2e1-40e6-b509-6eed7b58b8b6","year":2017},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.186211Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:f5904aba3df8c7c59f2725e972a5e27417ea11656e28e89068d05684d71629e4","observation_id":"cfb384ba-44b2-4c07-a19a-0f61bd8b4ed1","resolution":{"observed_at":"2026-08-16T04:37:49.245551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-16T04:37:48.190037Z","title":"Li et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.190037Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:c8b244ef3fc51ea077a626e40af574a2fd22c9353bfd53c624c1f5898823ff30","observation_id":"9c90775c-b985-44a7-bf2a-15cfa4df7bce","resolution":{"observed_at":"2026-08-16T04:37:48.190037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12188","last_updated":"2022-03-26T19:20:53Z","snapshot_observed_at":"2026-08-16T17:12:28.322939Z","submitted_at":"2022-03-23T04:33:09Z","title":"FullSubNet+: Channel Attention FullSubNet with Complex Spectrograms for Speech Enhancement","version":2},"cited_work":{"arxiv_id":"2203.12188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.12188","snapshot_observed_at":"2026-08-16T04:37:48.674310Z","title":"FullSubNet+: Channel Attention FullSubNet with Complex Spectrograms for Speech Enhancement","venue":"cs.SD","work_id":"f9fb36e0-a0df-4e43-912b-3173287a40f0","year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.194354Z"},"links":{"cited_paper":"/paper/2203.12188","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:fe143a57af8f5c797df3faa2472c1368f7222d9fbbedac59d5945a849fc56fad","observation_id":"e6a3457d-525c-49bf-a094-d2f542d79b25","resolution":{"observed_at":"2026-08-16T04:37:48.679151Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.231048Z","title":"Logic-guided semantic representation learning for zero-shot rela- tion classification","venue":null,"work_id":"71f47382-13b0-490c-954f-0b77db45d6ae","year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.198266Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6b81b418b7d64496aea458b759037198b8357466412fed4c7bbe468930124bd1","observation_id":"e45a61a7-c140-43db-aaed-07d13c08ffa0","resolution":{"observed_at":"2026-08-16T04:37:49.235138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-16T04:37:48.205650Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.205650Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:cb62f3dfda83d80de87f44735c9497c0f7e226462a4294d626e88f324072972c","observation_id":"831e7284-0cf6-45ee-9524-d6c5dd07aa13","resolution":{"observed_at":"2026-08-16T04:37:48.205650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.217757Z","title":null,"venue":null,"work_id":"e18ede3d-997d-44ea-893f-31eb58fa1890","year":2000},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.209848Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:83c9c678afe304fe6d4947572399a49f8176c7d209ee454e6bedc711089ee703","observation_id":"1a65f7fe-3482-462c-9597-77996dcf39b8","resolution":{"observed_at":"2026-08-16T04:37:49.222196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.206615Z","title":"Ling et al","venue":null,"work_id":"d1a0a364-3af2-4385-931e-eb67b8e89ac4","year":2017},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.214027Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6605daef035276272f4bf8d684d72b8558df6d3a3172590ffebb8d0540bdbe4b","observation_id":"d00db2f8-e117-4ee5-919b-2ecb525999c9","resolution":{"observed_at":"2026-08-16T04:37:49.210050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-16T04:37:48.217632Z","title":"Liu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.217632Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:28f01a397ce4724ad79ce5e7ec3a4c3ffdba16b075ccca2f26133ce5b9fd58e1","observation_id":"db7db0de-16e4-4d49-baeb-e5e6ac23a2cd","resolution":{"observed_at":"2026-08-16T04:37:48.217632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.195096Z","title":"Multi-task deep neural networks for natural language understanding","venue":null,"work_id":"6b823cb7-d8d5-457d-95fa-cb5045e3f9d9","year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.222157Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:901abdeacc2bec58b875937280db1eff23f17c94e8214b4e3d7cd9820461b5a9","observation_id":"a6a2dfa2-6efa-46c1-a759-b9085bd354d5","resolution":{"observed_at":"2026-08-16T04:37:49.199025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.183562Z","title":"Chatbot arena: Benchmarking llms in the wild with elo ratings, 2023","venue":null,"work_id":"a565b7d4-4350-4b95-8f4e-773a36c7c765","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.226185Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:1e6ae7ce57cf97370e2cf6cfd9045d9f91fff2a4bdd43a51c962e21763812b2f","observation_id":"b8913c74-bd33-4f88-a351-180100d1b3f1","resolution":{"observed_at":"2026-08-16T04:37:49.187474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.172943Z","title":null,"venue":null,"work_id":"bc00c3b1-db7b-46fa-9e7d-442e3c661ea1","year":1993},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.229949Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a11f0a1cc91b3eddaf60c8eba95edf81ba22286fa0621eda1f8aa4f65059bda0","observation_id":"616b497a-4e7b-427e-ba58-e5dc2d1649de","resolution":{"observed_at":"2026-08-16T04:37:49.176507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.160999Z","title":"Algo- rithmic fairness: Choices, assumptions, and definitions","venue":null,"work_id":"24d25ff6-117e-4f8a-9f77-1bb83480f952","year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.233885Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:572b646331f57d735f5215f7dbf236bf217e7a5b09d64e902b75581c10ac858f","observation_id":"c3978adb-d0a4-477d-b7ba-82ec23122cea","resolution":{"observed_at":"2026-08-16T04:37:49.165203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.148800Z","title":"Principles alone cannot guarantee ethical ai","venue":null,"work_id":"ce3d4730-20b1-47d4-b573-78287fd782d3","year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.237789Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:f58f30bb0c8b5695e0870155635d5e33adfd69e03be825a142ab89f15d4284aa","observation_id":"6679eebf-8522-42c8-ac87-438bc58d6aac","resolution":{"observed_at":"2026-08-16T04:37:49.152631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.136430Z","title":"Interpretable machine learning","venue":null,"work_id":"ccff8dcc-0a63-4210-bb88-7a174c648913","year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.241651Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a2c6361fc98857944cc1ae86e9e33b578b00226f3e339ea4ed265b1022daa688","observation_id":"3b58ee3a-10f7-4a3b-bd75-2a7070fbed13","resolution":{"observed_at":"2026-08-16T04:37:49.140807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.122161Z","title":"Translation tutorial: 21 fairness definitions and their politics","venue":null,"work_id":"5397a1c5-ba91-4869-9e1f-d9fc7ed50d4c","year":2018},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.245596Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:035ae2f71a1e0f89d813a15bb115c4a779ff847f439d3bc6c5a9037998ec57f6","observation_id":"a45c478c-cd8c-4499-a8f7-428a6c32bfab","resolution":{"observed_at":"2026-08-16T04:37:49.126410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.110550Z","title":"trolley problem","venue":null,"work_id":"631e44bd-cfa4-4d9c-a0e0-2752ffec2ad5","year":2012},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.250980Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:70acca5b6521130d6868c41f1bf8f0571e2b093b056779c68989e2776a39976e","observation_id":"53fa1282-63cf-4f41-b042-16046629838f","resolution":{"observed_at":"2026-08-16T04:37:49.114356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.098952Z","title":null,"venue":null,"work_id":"c08a4cf3-6ba5-4691-b747-850dd5017f51","year":2003},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.255343Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:22420626a19606e1bc839ee55060384d3c46930123dbf7181e5c1bffc8af7ea3","observation_id":"ece19c91-c7d0-4f29-9527-ed7806ad51d0","resolution":{"observed_at":"2026-08-16T04:37:49.102674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:37:48.259484Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.259484Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:73e07b9fde0564c2d4f9e94c9670310311d6e0d221d017539bfca6aa6ad932e6","observation_id":"142dd244-394c-493f-91d0-3666184a42ff","resolution":{"observed_at":"2026-08-16T04:37:48.259484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.087642Z","title":"Paolacci, J","venue":null,"work_id":"8e8686d6-5c95-4512-8df1-4ef4ee2b79c9","year":2010},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.262982Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:964dd9ca83093ced1443904c19031414e1e92976d577d5d02db1d24ac6489ef4","observation_id":"2f629139-ab87-49f5-98d7-cba9cead5372","resolution":{"observed_at":"2026-08-16T04:37:49.091343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-16T04:37:48.266435Z","title":"Rae et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.266435Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:4c27b932bfb3e400cf447bb14e63fdb7adf371692b9935362de64c61e7e38ff7","observation_id":"3b6d4b33-e1d3-4f61-af8f-f5be3603b769","resolution":{"observed_at":"2026-08-16T04:37:48.266435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.076393Z","title":"Closing the ai accountability gap: Defining an end-to-end framework for internal algorithmic auditing","venue":null,"work_id":"e0accaa8-ec98-4dd4-aeea-d3e41e2a3cdf","year":2020},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.270520Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:84a67ea8565add50e67045f6241a9f58a1d70ecc081038256053ef149a0c83cf","observation_id":"c70c94b0-5cec-4c2f-bb9e-4e2b35ab98b0","resolution":{"observed_at":"2026-08-16T04:37:49.080431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.273983Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.273983Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:be9ed2105ba06a21666b98b375ffe8d52eef061a337d2ffc6a3a6abd3a7e9569","observation_id":"7b478798-fa0a-43a8-bb76-850d9afa1714","resolution":{"observed_at":"2026-08-16T04:37:48.273983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.058785Z","title":null,"venue":null,"work_id":"c990c0a5-7e13-4210-a304-cc2f319e765f","year":1979},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.277579Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6f08826d82266d5a8a73f510ff8b122fe6b15ed96d3e4bc21b85c08f0e741a81","observation_id":"55ea9473-b12c-4899-8082-2e6c2479fe9f","resolution":{"observed_at":"2026-08-16T04:37:49.062330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.047329Z","title":"Adaptive testing and debugging of nlp models","venue":null,"work_id":"afe5d8b1-38d5-4dec-a328-0bfde0560027","year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.281173Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:d104920b7ab383a7e3c807ed2cb709935f06769cbd192997b4ddff275c5bb0ce","observation_id":"383f21b7-2b5b-4647-8f12-4142035255c9","resolution":{"observed_at":"2026-08-16T04:37:49.051321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.035439Z","title":"Rudinger et al","venue":null,"work_id":"35e169d1-3d32-4b7c-ac96-e3b483bc09de","year":2018},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.284555Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6235e64f1ae6a48ea00780b5ddec4937a129c77c40fcf8bda5637b563e2b8aa8","observation_id":"7477c323-1a21-42d5-bdf0-0b3867be9515","resolution":{"observed_at":"2026-08-16T04:37:49.039533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.023604Z","title":"Sap et al","venue":null,"work_id":"3e34950f-85b8-4faf-a300-cf0dcccad757","year":2020},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.288407Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6cd71af27d18b0a496074081aa7fef1dc8b38f8cdd9ac9a120eafe76d235ba92","observation_id":"2aa00da1-5605-4f60-8d02-674d51bb3826","resolution":{"observed_at":"2026-08-16T04:37:49.027351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:49.011913Z","title":"big three","venue":null,"work_id":"2314887b-3d62-4eda-972e-9bb9e1aebb3d","year":1997},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.292151Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:33a57e9e69d6ead15eee0f32519620ea478e7a039632b4209d86899e1e0ac2e8","observation_id":"7ba73739-2ff6-4ecc-b0c0-b0707bfaded1","resolution":{"observed_at":"2026-08-16T04:37:49.015772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.999849Z","title":"Singhal et al","venue":null,"work_id":"bad3771e-6a61-4e11-b68f-3352ac1ee2d2","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.295938Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:633277a46bcfb9896b08e342dc61cd9183186c9f9faf32ba7364cd22876146f7","observation_id":"69269a41-cb9b-4dec-b4b3-51b85c4e96d0","resolution":{"observed_at":"2026-08-16T04:37:49.003834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.988569Z","title":"Open-source tools learning benchmarks, 2023","venue":null,"work_id":"4218a617-8658-4eb6-aaf3-beecdafc51a9","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.299533Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:bd4771886f140862cd7c8a19db58eb3a2bafb5fe69de0c5d5b24e5789a6c819b","observation_id":"80cb5ae2-09d4-48d9-a794-d76c3b7cf2d6","resolution":{"observed_at":"2026-08-16T04:37:48.992551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.303111Z","title":"High-performance medicine: the convergence of human and artificial intelligence","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.303111Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:cfee053f554a185ed876444ac2a0a551794b5f97e3a48368bb253d7347438200","observation_id":"981f48d9-e247-4ee5-a2dd-25cbf38a9821","resolution":{"observed_at":"2026-08-16T04:37:48.303111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T04:37:48.306679Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.306679Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:1da53352176727c07630e6ea132e468777544a886b2873f315dfeb66a7c89127","observation_id":"86028ba9-313d-4213-93d7-85af4d116abe","resolution":{"observed_at":"2026-08-16T04:37:48.306679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06598","last_updated":"2023-06-11T06:11:56Z","snapshot_observed_at":"2026-08-16T15:24:51.284447Z","submitted_at":"2023-06-11T06:11:56Z","title":"RoBERTweet: A BERT Language Model for Romanian Tweets","version":1},"cited_work":{"arxiv_id":"2306.06598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.06598","snapshot_observed_at":"2026-08-16T04:37:48.604565Z","title":"RoBERTweet: A BERT Language Model for Romanian Tweets","venue":"cs.CL","work_id":"6dfc7f05-c81c-42bf-96b9-710316c772a6","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.310229Z"},"links":{"cited_paper":"/paper/2306.06598","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:6cf0f1d69765ef8bda789832345dac6a7e7ba658f1dc335541a0c8cb6198ec9f","observation_id":"b85ee886-52c3-46e8-bdc3-1d8ae7a2f650","resolution":{"observed_at":"2026-08-16T04:37:48.608348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05082","last_updated":"2023-07-11T07:31:58Z","snapshot_observed_at":"2026-08-16T15:17:12.807643Z","submitted_at":"2023-07-11T07:31:58Z","title":"OntoChatGPT Information System: Ontology-Driven Structured Prompts for ChatGPT Meta-Learning","version":1},"cited_work":{"arxiv_id":"2307.05082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05082","snapshot_observed_at":"2026-08-16T04:37:48.589345Z","title":"OntoChatGPT Information System: Ontology-Driven Structured Prompts for ChatGPT Meta-Learning","venue":"cs.AI","work_id":"d3e3f5c2-45e2-448b-bed0-23a23ad752ad","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.314185Z"},"links":{"cited_paper":"/paper/2307.05082","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:ede42ea3a1fbad30859cedf12d316e0bf14c46f7c33993afd0bf3f07077b1283","observation_id":"46193ff2-c3e1-4232-bb14-30529a1e51b5","resolution":{"observed_at":"2026-08-16T04:37:48.593268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06975","last_updated":"2023-07-18T21:27:25Z","snapshot_observed_at":"2026-08-16T15:16:31.037581Z","submitted_at":"2023-07-13T13:52:41Z","title":"Neuro-symbolic Empowered Denoising Diffusion Probabilistic Models for Real-time Anomaly Detection in Industry 4.0","version":2},"cited_work":{"arxiv_id":"2307.06975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06975","snapshot_observed_at":"2026-08-16T04:37:48.571340Z","title":"Neuro-symbolic Empowered Denoising Diffusion Probabilistic Models for Real-time Anomaly Detection in Industry 4.0","venue":"cs.LG","work_id":"053fa694-9afb-4871-9ba8-61e33b5fee80","year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.318191Z"},"links":{"cited_paper":"/paper/2307.06975","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:1e5c6b40037425cfd4bcb6b9c8d6b1ac7e75d45f82b9223bcc0f3084622881ca","observation_id":"a6bb601f-3bbf-48fc-8d1b-3b12079d8c9a","resolution":{"observed_at":"2026-08-16T04:37:48.577479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-16T04:37:48.321759Z","title":"Self- consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.321759Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:4733ef19e3a444c15008f3cf384f52da917988a447ca315c12e34bafd3685dff","observation_id":"88605bc5-37d3-4b52-a56c-fa08226812eb","resolution":{"observed_at":"2026-08-16T04:37:48.321759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-16T04:37:48.325272Z","title":"Chain of thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.325272Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:2ce650ccb181a95f35bdf310dd498131277a8f28fbaffd39884438e93030c0e8","observation_id":"86101bca-74bb-4827-98d6-7e582f646538","resolution":{"observed_at":"2026-08-16T04:37:48.325272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.967433Z","title":"Taxonomy of risks posed by language models","venue":null,"work_id":"12811170-4364-4820-bf20-dec9084aeb2a","year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.328791Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a5ce9cf4a0b49bab660a9a277de37f2e1156d9b29dd7c2aecefa632e8bb324d2","observation_id":"ce4c9d8b-e2cd-45c1-a628-514a3878dad4","resolution":{"observed_at":"2026-08-16T04:37:48.971633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.955741Z","title":"The role and limits of principles in ai ethics: towards a focus on tensions","venue":null,"work_id":"29ffa13a-ede4-43f4-84c9-1cae8b128c54","year":2019},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.332335Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:84b7d334370cd0a1cf047c6e799d13981e0817de18038b9c5270ab563663dfdc","observation_id":"964b971e-65c4-481f-9efc-fe8047da056e","resolution":{"observed_at":"2026-08-16T04:37:48.959838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.943517Z","title":"Transformers: State- of-the-art natural language processing","venue":null,"work_id":"b7dd0b0e-6288-4f46-9a67-0b59c4a00c70","year":2020},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.335926Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:31221c08d79fb1baf1adf646ac68301ebd38616d00c6dd15e10bac6b8d338fa4","observation_id":"f4ba6393-c4c0-4c73-9d30-d7cd4d07eb82","resolution":{"observed_at":"2026-08-16T04:37:48.947716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09705","last_updated":"2023-07-19T01:22:40Z","snapshot_observed_at":"2026-08-16T15:15:09.528940Z","submitted_at":"2023-07-19T01:22:40Z","title":"CValues: Measuring the Values of Chinese Large Language Models from Safety to Responsibility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09705","snapshot_observed_at":"2026-08-16T04:37:48.339825Z","title":"Xu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.339825Z"},"links":{"cited_paper":"/paper/2307.09705","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:149d43601294927ec2ade706511e1ad77d4d563f30da4bffbd297ee2deeaa586","observation_id":"aa9dca84-ffc0-4444-acd3-c68c91ed0ad3","resolution":{"observed_at":"2026-08-16T04:37:48.339825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-08-16T15:23:35.593791Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-16T04:37:48.343494Z","title":"Xu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.343494Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:3c545fb5b6e30829359c669c02d9a436834b85f521139b94fda1e10dda7e95b9","observation_id":"191847ee-4d65-463a-88c4-f1161a1b1f10","resolution":{"observed_at":"2026-08-16T04:37:48.343494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08073","last_updated":"2023-05-22T11:55:52Z","snapshot_observed_at":"2026-08-16T16:16:04.164694Z","submitted_at":"2022-11-15T11:53:55Z","title":"GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08073","snapshot_observed_at":"2026-08-16T04:37:48.347641Z","title":"Yang et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.347641Z"},"links":{"cited_paper":"/paper/2211.08073","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:82fc233433e882f709c720125ac7ec49aca8d07bd4042511752f03c512488969","observation_id":"279fea2c-e9de-4ef9-884f-ffd73af4f865","resolution":{"observed_at":"2026-08-16T04:37:48.347641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-16T04:37:48.351258Z","title":"Yang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.351258Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:68f326ba09ee3f7afaceef8706a66a5452775234f3c9b98980885128506fbf2f","observation_id":"f5792766-c14b-4fac-81cb-31b3dd1f8ac2","resolution":{"observed_at":"2026-08-16T04:37:48.351258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06687","last_updated":"2023-11-06T07:02:19Z","snapshot_observed_at":"2026-08-19T05:26:51.688919Z","submitted_at":"2023-06-11T14:01:17Z","title":"LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06687","snapshot_observed_at":"2026-08-16T04:37:48.355011Z","title":"Yang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.355011Z"},"links":{"cited_paper":"/paper/2306.06687","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:bfda596b704d401daef90a72fd255324266bc9506d4972201878dbaebdf01508","observation_id":"99624c16-5789-4d07-b095-041830f90515","resolution":{"observed_at":"2026-08-16T04:37:48.355011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-16T04:37:48.358809Z","title":"Yang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.358809Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:33fb8f18e31fb293fa12a6b5a4c67cf98263479b508652194e23faf9758cba85","observation_id":"802b8577-1e88-4fd8-9f10-4a304aa202e5","resolution":{"observed_at":"2026-08-16T04:37:48.358809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.931427Z","title":"Young et al","venue":null,"work_id":"20a04871-db37-4639-afe5-de1c3c787c10","year":2010},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.362651Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:3c82c532f4bdef5ed8cb573c700039dcafb4a54edd83e7685a870b446bbdde26","observation_id":"83a5518d-8949-4ec1-9a06-6176c4497ef9","resolution":{"observed_at":"2026-08-16T04:37:48.935195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09296","last_updated":"2024-07-01T03:38:57Z","snapshot_observed_at":"2026-08-16T15:23:34.684133Z","submitted_at":"2023-06-15T17:20:46Z","title":"KoLA: Carefully Benchmarking World Knowledge of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09296","snapshot_observed_at":"2026-08-16T04:37:48.366110Z","title":"Yu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.366110Z"},"links":{"cited_paper":"/paper/2306.09296","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:9d4790d1c4d580a95e47d51f5eacea4face62d81778f14d62fbdeda86806b65f","observation_id":"5253eb86-bf16-4c6e-991a-f285dfb20531","resolution":{"observed_at":"2026-08-16T04:37:48.366110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:37:48.919839Z","title":null,"venue":null,"work_id":"83029acd-590d-48a9-ab18-1da173fbc0d6","year":2008},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.369629Z"},"links":{"citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a54c66563ec851d01b7e5ed37da2acb1a27412a852903ff3e1cbce89f5ece378","observation_id":"61c6553d-e5a2-4d3a-b8af-d5bd4296f226","resolution":{"observed_at":"2026-08-16T04:37:48.923839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05179","last_updated":"2023-11-10T04:11:01Z","snapshot_observed_at":"2026-08-16T15:25:29.534724Z","submitted_at":"2023-06-08T13:21:29Z","title":"M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05179","snapshot_observed_at":"2026-08-16T04:37:48.372907Z","title":"Zhang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.372907Z"},"links":{"cited_paper":"/paper/2306.05179","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:c98877de08a03126de9f991b50699e36e8cfb872bbaf4123780b7643b47116cc","observation_id":"5c8f6f66-3df2-4c73-b06c-b9c0b0d1ae7e","resolution":{"observed_at":"2026-08-16T04:37:48.372907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09690","last_updated":"2021-06-10T18:20:59Z","snapshot_observed_at":"2026-08-18T14:24:32.140370Z","submitted_at":"2021-02-19T00:23:59Z","title":"Calibrate Before Use: Improving Few-Shot Performance of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09690","snapshot_observed_at":"2026-08-16T04:37:48.376928Z","title":"Calibrate before use: Improving few-shot performance of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.376928Z"},"links":{"cited_paper":"/paper/2102.09690","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:351545de9c2dfeca1bb432513c638afd7f1fcd951e8300dd0fa2012591ebb9a0","observation_id":"82e1f6db-97a6-4fc6-a326-483874931705","resolution":{"observed_at":"2026-08-16T04:37:48.376928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13656","last_updated":"2023-05-23T03:59:21Z","snapshot_observed_at":"2026-08-16T15:30:49.282521Z","submitted_at":"2023-05-23T03:59:21Z","title":"Link Prediction without Graph Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13656","snapshot_observed_at":"2026-08-16T04:37:48.380613Z","title":"Zheng et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.380613Z"},"links":{"cited_paper":"/paper/2305.13656","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:0b2f29d30cd0277ec89693fbf238c30ce93eeb3783412f56215ce0e0ccbc4212","observation_id":"d2248598-2530-459f-a0d1-92e4c608773f","resolution":{"observed_at":"2026-08-16T04:37:48.380613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-16T04:37:48.384477Z","title":"Zhong et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.384477Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:0e60de9ec9a36c6f65d5eb20466fd9f842ed1b5f3f83e8347d4cbd8979f7c0f2","observation_id":"f1ebe5d4-d1d6-4bed-81cb-46131d2f3664","resolution":{"observed_at":"2026-08-16T04:37:48.384477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-18T10:45:11.561476Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-16T04:37:48.388254Z","title":"Zhu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.388254Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:592753bd0a3ab307d08c95c274c492b45dbb9d96423f9c1b0961a2457c13be05","observation_id":"b92028cd-1ee1-430a-a541-34bfd3e9fd0b","resolution":{"observed_at":"2026-08-16T04:37:48.388254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","latest_version":1,"primary_category":"cs.CY","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":66,"verified_exact":4,"verified_fuzzy":28},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 1 inbound Pith citation observation for arXiv:2505.00853."}