{"as_of":"2026-08-18T07:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e025488d5e557efd96cfc10972861fa81bcf6b4468b15774ba2a45ebd973ad13","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:24:59.539102Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T21:36:34.279815Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2303.17491","last_updated":"2023-11-16T20:15:14Z","snapshot_observed_at":"2026-08-14T05:01:21.886306Z","submitted_at":"2023-03-30T16:01:52Z","title":"Language Models can Solve Computer Tasks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T12:17:26.602361Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2303.17491"},"observation_digest":"sha256:823482177942a5675a144dba966fa698a770da33427d98a6a9194319fe4391c2","observation_id":"149d118c-5cdb-4547-b1bb-da70e3050926","resolution":{"observed_at":"2026-05-17T12:17:26.788090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-12T06:24:24.607354Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2304.05128"},"observation_digest":"sha256:dfa21bf3a5e232e866305c7943bec853d1284fcd97d005b8ec2a7abb3a888d04","observation_id":"07864920-420d-4a91-83b8-9b9fcc771be8","resolution":{"observed_at":"2026-05-12T06:24:24.808331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":176,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:5a00c2b30956a7d96cb96491e7ea96727fea039f30a55b697c8fbfd59ec663bd","observation_id":"0b9cd473-741f-43d5-97be-ca4f9c6a8e13","resolution":{"observed_at":"2026-05-19T20:28:39.562148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2309.02427","last_updated":"2024-03-15T15:44:11Z","snapshot_observed_at":"2026-08-18T07:01:35.707347Z","submitted_at":"2023-09-05T17:56:20Z","title":"Cognitive Architectures for Language Agents","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T19:33:44.146134Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2309.02427"},"observation_digest":"sha256:70e5916c797ab4c9d7adf21806deba2de6dc257f3faf1485ce8039a3a700544d","observation_id":"0ae7da65-0ca0-476e-b3f9-c8ebc989590e","resolution":{"observed_at":"2026-05-16T19:33:44.333626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-08-15T09:21:11.223719Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T00:04:31.212102Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2309.03409"},"observation_digest":"sha256:d033cc5e9581bc24eb3b70ee1039e76b8947c78c2f719bf1ec0ae8ff280a2230","observation_id":"74654157-bd1a-4329-bf0f-bdbc71872afc","resolution":{"observed_at":"2026-05-15T00:04:31.261649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T05:48:24.133045Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2310.01798"},"observation_digest":"sha256:7fe3c703473920e7dd74c69536644a5ff33c6e9c59512f8ef1180a8c88f7f239","observation_id":"1c830fb9-5ae1-4ecd-b80d-22d042172d50","resolution":{"observed_at":"2026-05-12T05:48:24.649228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-08-13T01:25:06.346704Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T09:24:13.911401Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2310.02446"},"observation_digest":"sha256:63310ca4cc5c1c439aeede5ee6c2f52f7fd55ed486a15650b0f6fd3e6db9b286","observation_id":"ca8d4468-837a-4cf2-9522-c86a72686373","resolution":{"observed_at":"2026-05-17T09:24:13.993100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-05-10T17:34:42.565806Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2403.07974"},"observation_digest":"sha256:f19e442d1580179e392e721930912ec9cfd9c07c4bd10db4f9fc0a9e95bc5658","observation_id":"d2c72841-ded1-483c-8ec5-bda52fefa590","resolution":{"observed_at":"2026-05-10T17:34:42.734237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":256,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:c3b1d05b8e82e9ce2f2b8be5549c5d42eb32a1e4605a7b05d2e71787cba29e4d","observation_id":"d94a8a51-2420-4ff4-85fa-80d1531e32e6","resolution":{"observed_at":"2026-05-18T06:38:37.056783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-12T21:59:11.403148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08147","last_updated":"2024-11-12T19:53:00Z","snapshot_observed_at":"2026-08-14T22:04:50.847373Z","submitted_at":"2024-11-12T19:53:00Z","title":"Large Language Models Can Self-Improve in Long-context Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T21:59:11.403148Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2411.08147"},"observation_digest":"sha256:7e565b483957c8033fde94635b9e1c19343468a017cebadd3001f60b42e8a011","observation_id":"6dedd3d2-c6c3-436a-84b4-af3b8e919535","resolution":{"observed_at":"2026-08-12T21:59:11.403148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-11T15:02:33.198617Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11414","last_updated":"2024-12-16T03:29:08Z","snapshot_observed_at":"2026-08-15T19:51:21.848714Z","submitted_at":"2024-12-16T03:29:08Z","title":"Biased or Flawed? Mitigating Stereotypes in Generative Language Models by Addressing Task-Specific Flaws","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:02:33.198617Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2412.11414"},"observation_digest":"sha256:276759ce9375de66d821a6ff8d1f9f6cc15e55c25424c4f4b0971012c11a7734","observation_id":"e3e7b37d-073b-4f93-b286-7d73d84a736d","resolution":{"observed_at":"2026-08-11T15:02:33.198617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2412.15176","last_updated":"2026-04-20T11:16:26Z","snapshot_observed_at":"2026-08-13T12:58:31.150566Z","submitted_at":"2024-12-19T18:51:06Z","title":"Rethinking Uncertainty Estimation in LLMs: A Principled Single-Sequence Measure","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T06:22:25.496269Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2412.15176"},"observation_digest":"sha256:3fa32cb888e0199d319d8ff5baff06cd2cc569c826893c5f94ba7e66409a20e0","observation_id":"53314db9-ef6e-4ce6-a33e-593c3817681b","resolution":{"observed_at":"2026-05-23T06:22:38.178394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-10T22:18:05.680475Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02295","last_updated":"2025-06-03T06:37:54Z","snapshot_observed_at":"2026-08-15T11:48:21.702136Z","submitted_at":"2025-01-04T14:08:52Z","title":"Explicit vs. Implicit: Investigating Social Bias in Large Language Models through Self-Reflection","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:05.680475Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2501.02295"},"observation_digest":"sha256:dbc3aa30411f59a0bb6364f628fca9af12373bf41b6147fec0969536006c94c2","observation_id":"c5cb5273-24f3-43b9-a98e-2e78ea4f55eb","resolution":{"observed_at":"2026-08-10T22:18:05.680475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-10T20:14:58.768223Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09223","last_updated":"2025-06-15T13:24:11Z","snapshot_observed_at":"2026-08-15T10:26:22.406164Z","submitted_at":"2025-01-16T01:03:56Z","title":"Foundations of Large Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T20:14:58.768223Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2501.09223"},"observation_digest":"sha256:8d673ecb3096d9c2ca5f719a91915e11219adfa2ee58bb401566e118034190a7","observation_id":"63bb554f-d214-4413-ba0e-1629fc133caf","resolution":{"observed_at":"2026-08-10T20:14:58.768223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-10T15:18:19.037689Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14294","last_updated":"2025-03-02T06:49:21Z","snapshot_observed_at":"2026-08-17T13:24:00.868239Z","submitted_at":"2025-01-24T07:24:23Z","title":"Examining Alignment of Large Language Models through Representative Heuristics: The Case of Political Stereotypes","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T15:18:19.037689Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2501.14294"},"observation_digest":"sha256:3f97ded4efeadc66dbce08ca6d5456b4f7ce9e5d7ee56ed8ee9eda45f94ab6f8","observation_id":"6bfb490b-80d9-430e-b81b-1cc57021624d","resolution":{"observed_at":"2026-08-10T15:18:19.037689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-10T14:25:13.128436Z","title":"Liao, Kamil˙ e Lukoˇ si¯ ut˙ e, Anna Chen, Anna Goldie, Azalia Mirhoseini, Catherine Olsson, Danny Hernandez, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15453","last_updated":"2025-01-28T06:35:32Z","snapshot_observed_at":"2026-08-15T19:34:30.287297Z","submitted_at":"2025-01-26T08:49:46Z","title":"Data-adaptive Safety Rules for Training Reward Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:13.128436Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2501.15453"},"observation_digest":"sha256:6326635cc72867e4c896f5c9e2a5ee7f3b3ac3ddefce77beb37d362561a60baf","observation_id":"baeecbd7-6222-423c-bd54-a7e288f10e8e","resolution":{"observed_at":"2026-08-10T14:25:13.128436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-09T20:09:54.043982Z","title":"I., Lukošiūtė, K., and more","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00136","last_updated":"2025-05-28T05:28:29Z","snapshot_observed_at":"2026-08-17T09:59:54.637367Z","submitted_at":"2025-01-31T19:41:28Z","title":"A Checks-and-Balances Framework for Context-Aware Ethical AI Alignment","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T20:09:54.043982Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2502.00136"},"observation_digest":"sha256:89209b43c2338031f55854c1556ba75655963de536f60e1a3827ef02b217d745","observation_id":"1968ce0f-9a1e-4384-9168-7da50c9e8cd4","resolution":{"observed_at":"2026-08-09T20:09:54.043982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-09T14:03:44.403660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01926","last_updated":"2025-08-11T14:37:48Z","snapshot_observed_at":"2026-08-15T02:26:57.999999Z","submitted_at":"2025-02-04T01:56:28Z","title":"Fairness through Difference Awareness: Measuring Desired Group Discrimination in LLMs","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:03:44.403660Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2502.01926"},"observation_digest":"sha256:28ee0639794bbdce46e5937197e1af15eda989e6addd0473c340ecd4b3a18c1d","observation_id":"f59dbf2d-9322-421d-8f5e-178568ba72be","resolution":{"observed_at":"2026-08-09T14:03:44.403660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-09T04:13:44.247895Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03678","last_updated":"2025-06-01T19:23:43Z","snapshot_observed_at":"2026-08-13T12:34:12.003563Z","submitted_at":"2025-02-05T23:53:08Z","title":"Reflection-Window Decoding: Text Generation with Selective Refinement","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T04:13:44.247895Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2502.03678"},"observation_digest":"sha256:ddd654a20097a9df909f395c5a1d935b0272c4c1722b0aa8d4bf71a9e8500d13","observation_id":"f108862d-1a37-4cfa-b9ec-9a2212584ec8","resolution":{"observed_at":"2026-08-09T04:13:44.247895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-08T11:42:07.337104Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07771","last_updated":"2025-02-11T18:55:57Z","snapshot_observed_at":"2026-08-13T09:22:58.255729Z","submitted_at":"2025-02-11T18:55:57Z","title":"Breaking Down Bias: On The Limits of Generalizable Pruning Strategies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T11:42:07.337104Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2502.07771"},"observation_digest":"sha256:3776d4372ab4c15278841f224e47b0a26b0abe94f9b5ca4c52328913ba06f7db","observation_id":"751caf8e-eca2-4170-a6ff-ec9796f26cff","resolution":{"observed_at":"2026-08-08T11:42:07.337104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-16T12:24:59.539102Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12898","last_updated":"2025-05-27T02:25:41Z","snapshot_observed_at":"2026-08-16T12:30:07.052526Z","submitted_at":"2025-04-17T12:39:25Z","title":"Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:24:59.539102Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2504.12898"},"observation_digest":"sha256:348da8378073fbb7656d0cd8e50c1e419df1372e875d5f1329c8ffdd95f4f06c","observation_id":"c2069a82-2f6f-4986-be4f-79441d1df4e4","resolution":{"observed_at":"2026-08-16T12:24:59.539102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-16T11:58:23.577593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14212","last_updated":"2025-09-03T03:06:20Z","snapshot_observed_at":"2026-08-16T11:52:00.167445Z","submitted_at":"2025-04-19T07:36:02Z","title":"Bias Analysis and Mitigation through Protected Attribute Detection and Regard Classification","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:58:23.577593Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2504.14212"},"observation_digest":"sha256:993aefce54cf5b46e9a7d1100093b4f0230b3a82686d4c53d8980a0472e96820","observation_id":"d3187f13-3880-49ea-99b9-117e8c96b578","resolution":{"observed_at":"2026-08-16T11:58:23.577593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-16T04:36:47.085804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00821","last_updated":"2025-08-09T05:24:54Z","snapshot_observed_at":"2026-08-18T04:24:13.041646Z","submitted_at":"2025-05-01T19:24:39Z","title":"Should AI Mimic People? Understanding AI-Supported Writing Technology Among Black Users","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:36:47.085804Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2505.00821"},"observation_digest":"sha256:557b371fe0f4c16ce6cce55ccfffbd30beb4cbe228ce935d37d153b74c786019","observation_id":"24701a4b-1fc4-4550-8d2d-63eb5f9e0848","resolution":{"observed_at":"2026-08-16T04:36:47.085804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-16T04:37:48.063908Z","title":"On the role of reasoning in moral alignment of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00853","last_updated":"2025-05-01T20:36:19Z","snapshot_observed_at":"2026-08-16T08:05:56.374210Z","submitted_at":"2025-05-01T20:36:19Z","title":"LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:37:48.063908Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2505.00853"},"observation_digest":"sha256:a40a24fc5cf95cccab9ff8d8b803d5b2d0db9ac5e8796f29c0997e956498cec3","observation_id":"c3ce01d4-a0f0-4d49-a4aa-9f545825b134","resolution":{"observed_at":"2026-08-16T04:37:48.063908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-15T20:36:57.249783Z","title":"Ganguli et al., ‘‘The capacity for moral self-correction in large language models,’’ 2023, arXiv:2302.07459","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17066","last_updated":"2025-08-11T12:32:14Z","snapshot_observed_at":"2026-08-15T20:30:31.940821Z","submitted_at":"2025-05-18T16:13:07Z","title":"Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:36:57.249783Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2505.17066"},"observation_digest":"sha256:2e8a0341cdab3ce42fada44018d64e77abd528ffd0d1f4d7f95c26f877326550","observation_id":"05c7c6da-0367-4364-b4a3-b20339ca4ae7","resolution":{"observed_at":"2026-08-15T20:36:57.249783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-07T14:22:55.542349Z","title":"Ganguli, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19212","last_updated":"2026-07-24T14:18:32Z","snapshot_observed_at":"2026-08-13T23:54:41.954779Z","submitted_at":"2025-05-25T16:19:24Z","title":"When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:55.542349Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2505.19212"},"observation_digest":"sha256:5c2141320828e6695e4ab7b621abcbbcedc567b67b0cc4074793c9361bc4b720","observation_id":"ab20ae17-7b33-41a4-928d-0cf1c23a9f40","resolution":{"observed_at":"2026-08-07T14:22:55.542349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-07T12:13:21.801364Z","title":"arXiv preprint arXiv:2302.07459 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00242","last_updated":"2025-05-30T21:16:25Z","snapshot_observed_at":"2026-08-13T16:30:11.011690Z","submitted_at":"2025-05-30T21:16:25Z","title":"Whispers of Many Shores: Cultural Alignment through Collaborative Cultural Expertise","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:13:21.801364Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2506.00242"},"observation_digest":"sha256:1373a8e88573847e6c7cdc6857a0cc87b0f59c6075e0a631278540df19a0e8dd","observation_id":"18762a2e-951c-4066-9112-e4e92f5fba79","resolution":{"observed_at":"2026-08-07T12:13:21.801364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-07T11:04:00.028467Z","title":"The capacity for moral self- correction in large language models.arXiv preprint arXiv:2302.07459, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03573","last_updated":"2025-06-04T04:43:15Z","snapshot_observed_at":"2026-08-13T21:40:03.588467Z","submitted_at":"2025-06-04T04:43:15Z","title":"Exchange of Perspective Prompting Enhances Reasoning in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:00.028467Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2506.03573"},"observation_digest":"sha256:19855be411c1b7d2790d93225ed5b40584c7470dbe6bcc9ff641024899f73b4c","observation_id":"dc0fda96-a79d-41d2-bd94-0566c47ef569","resolution":{"observed_at":"2026-08-07T11:04:00.028467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-06T17:17:29.139322Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11316","last_updated":"2025-07-15T13:48:35Z","snapshot_observed_at":"2026-08-16T22:01:21.234905Z","submitted_at":"2025-07-15T13:48:35Z","title":"Internal Value Alignment in Large Language Models through Controlled Value Vector Activation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:17:29.139322Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2507.11316"},"observation_digest":"sha256:b4c7e8f2ff89e229917a8b11f9028e47ca38c7bda8512d717994f24d11e9e85a","observation_id":"fbc44730-4ea4-41bd-a0b0-7518f62f13e3","resolution":{"observed_at":"2026-08-06T17:17:29.139322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-05T22:58:34.281893Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-14T15:33:30.690043Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.281893Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:7c290b2c85f38abafd91ca54ca50660ca5739cafbe4762eb6689107dd356e31d","observation_id":"3bb6d37e-5fe3-4eee-ba19-fa80475479ff","resolution":{"observed_at":"2026-08-05T22:58:34.281893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2509.09708","last_updated":"2026-04-28T03:29:39Z","snapshot_observed_at":"2026-08-10T21:52:19.966437Z","submitted_at":"2025-09-07T02:29:07Z","title":"Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T18:56:13.680353Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2509.09708"},"observation_digest":"sha256:c096bb25d828590cf688f7e74bd0a5b3763babd97af2a76405ca9a4d6258f1a1","observation_id":"4fc69028-ca24-4e2e-83a6-e60b34a39393","resolution":{"observed_at":"2026-05-18T18:56:45.850733Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-04T17:41:05.230225Z","title":"Ganguli, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10753","last_updated":"2025-09-12T23:49:52Z","snapshot_observed_at":"2026-08-17T15:41:24.351229Z","submitted_at":"2025-09-12T23:49:52Z","title":"HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:05.230225Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2509.10753"},"observation_digest":"sha256:4966e0361d4daf533a75d0455f5bd3b719a54326b136a3e4b9cbf2ba90e01741","observation_id":"385a94ea-d6f0-4069-9fd8-4d2e082ba3ae","resolution":{"observed_at":"2026-08-04T17:41:05.230225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2509.22510","last_updated":"2026-05-15T12:53:06Z","snapshot_observed_at":"2026-08-14T16:32:52.758855Z","submitted_at":"2025-09-26T15:52:21Z","title":"We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-21T22:11:20.651761Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2509.22510"},"observation_digest":"sha256:49b309fd02a8411a8474cb945b56253e7fe3dc184b2e46049c8afc1d3ad60e46","observation_id":"1ccaa8a8-8275-4c93-aa2e-deb37ffaf330","resolution":{"observed_at":"2026-05-21T22:14:23.545726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-03T19:25:20.551987Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.00807","last_updated":"2026-07-29T16:14:32Z","snapshot_observed_at":"2026-08-18T02:30:20.583409Z","submitted_at":"2025-11-30T09:33:09Z","title":"BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:25:20.551987Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2512.00807"},"observation_digest":"sha256:1581f2735620f18a0733f2d905b52efe82df789444af4b3e5bdda342a1afc7b0","observation_id":"3ec12e0e-4a7a-47ca-b2f7-5dc1d3b5640a","resolution":{"observed_at":"2026-08-03T19:25:20.551987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-03T04:43:42.987351Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04306","last_updated":"2026-06-18T06:47:05Z","snapshot_observed_at":"2026-08-15T02:27:01.523266Z","submitted_at":"2026-02-04T08:15:51Z","title":"DeFrame: Debiasing Large Language Models Against Framing Effects","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:43:42.987351Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2602.04306"},"observation_digest":"sha256:277ecdcea47769d7b397712ad6b3114411e0c4b3fd0a2a96109a814ad6e9c9c4","observation_id":"d3811577-9d12-46b6-968d-3619ed56349d","resolution":{"observed_at":"2026-08-03T04:43:42.987351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2605.03217","last_updated":"2026-06-09T02:10:17Z","snapshot_observed_at":"2026-08-16T04:09:19.650667Z","submitted_at":"2026-05-04T23:12:32Z","title":"Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T18:34:20.065335Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2605.03217"},"observation_digest":"sha256:1c9c469348e2debf2cac534e4e3e9a1325092dcf5c8a3b3e26b1f169036c62d8","observation_id":"a52956e5-0878-45f6-8f99-ea0da6d9d165","resolution":{"observed_at":"2026-05-12T10:51:29.506430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2605.03217","last_updated":"2026-06-09T02:10:17Z","snapshot_observed_at":"2026-08-16T04:09:19.650667Z","submitted_at":"2026-05-04T23:12:32Z","title":"Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T23:59:10.797762Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2605.03217"},"observation_digest":"sha256:632d29651a79cc76f3530f8fc068d5488fad1dee2b5aa2101e0bdd3c482bb348","observation_id":"a19b7205-130e-4674-9cc6-f64ec74858fc","resolution":{"observed_at":"2026-07-01T00:25:10.319507Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2605.09128","last_updated":"2026-05-09T19:19:52Z","snapshot_observed_at":"2026-08-12T21:48:48.814873Z","submitted_at":"2026-05-09T19:19:52Z","title":"Internal vs. External: Comparing Deliberation and Evolution for Multi-Agent Constitutional Design","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T02:51:35.213002Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2605.09128"},"observation_digest":"sha256:65de0ddaca0150f62af731b1900bc32c519758225223892f7f6c79081b53bd63","observation_id":"c8076c4f-ce26-41d5-bac1-be6708a8e662","resolution":{"observed_at":"2026-05-12T07:26:31.959348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2605.10721","last_updated":"2026-05-11T15:30:48Z","snapshot_observed_at":"2026-08-15T20:38:38.492212Z","submitted_at":"2026-05-11T15:30:48Z","title":"Conformity Generates Collective Misalignment in AI Agents Societies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:34:53.814304Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2605.10721"},"observation_digest":"sha256:1c1016bd84ff72946f79e87c82ff5e979bd19c0fd8d1cf74751d3f4aa4b44030","observation_id":"f9ce0d48-ad37-45aa-b0c0-aa6602207968","resolution":{"observed_at":"2026-05-12T06:06:27.048080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":"2302.07459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-09T21:36:34.279815Z","title":"The capacity for moral self-correction in large language models","venue":"cs.CL","work_id":"16e940b0-9e2f-4ac1-b64f-ca0c8f2c07ee","year":2023},"citing_paper":{"arxiv_id":"2607.07023","last_updated":"2026-07-08T05:44:33Z","snapshot_observed_at":"2026-08-17T23:01:46.717205Z","submitted_at":"2026-07-08T05:44:33Z","title":"Online Data Selection Is Implicit Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T21:35:41.947875Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2607.07023"},"observation_digest":"sha256:595fa6e6a8a16974f0bb614da9774ded5b370fb8ed5854db22eefd8c980266f1","observation_id":"12806caf-14dc-4bc1-8de8-add97f3c4b96","resolution":{"observed_at":"2026-07-09T21:36:34.280994Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-07-30T12:26:06.939145Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24866","last_updated":"2026-07-26T18:12:41Z","snapshot_observed_at":"2026-08-15T02:27:01.635048Z","submitted_at":"2026-07-26T18:12:41Z","title":"The Missing Layer: Specification Infrastructure for AI Oversight","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-30T12:26:06.939145Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2607.24866"},"observation_digest":"sha256:366800b8464bacb78d2cc8c7beb4b0fa2f205178c7d7e60fed8dba7f2473af83","observation_id":"34db6765-7a34-49b8-8f82-bebcc6bf6aad","resolution":{"observed_at":"2026-07-30T12:26:06.939145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-11T15:29:05.544671Z","title":"The capacity for moral self-correction in large language models.arXiv preprint arXiv:2302.07459, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-17T23:17:18.948375Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.544671Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:a947ecd38fe20120b9c48c3bdba0078298b5b6e5d9fdb3e02dc6eabf4c92a5c7","observation_id":"11c5cfd8-6d5f-40e7-af5b-ef6cfff3b8ba","resolution":{"observed_at":"2026-08-11T15:29:05.544671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-14T13:21:16.568273Z","title":"I.; Lukošiūtė, K.; Chen, A.; Goldie, A.; Mirhoseini, A.; Olsson, C.; Hernandez, D.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13345","last_updated":"2026-08-13T15:15:09Z","snapshot_observed_at":"2026-08-18T00:20:47.598987Z","submitted_at":"2026-08-13T15:15:09Z","title":"Rules or Character? Scaling Laws for AI Safety Design","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T13:21:16.568273Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2608.13345"},"observation_digest":"sha256:c269ceb916a065383e2d281780277632f4167a155200339178a6dc3deee9752a","observation_id":"569f83e2-ef03-44a3-a815-8a60bc49cf49","resolution":{"observed_at":"2026-08-14T13:21:16.568273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2302.07459/citation-record","integrity":"/paper/2302.07459/integrity","json":"/paper/2302.07459/citation-record.json","paper":"/paper/2302.07459"},"outbound":[],"paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2302.07459."}