{"as_of":"2026-08-13T05:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1999561230cef797e12c60b4ab8acd40b58f428aabd5cf4c22b5e3fe1d3a743d","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:18:17.886907Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11145/citation-record","integrity":"/paper/2412.11145/integrity","json":"/paper/2412.11145/citation-record.json","paper":"/paper/2412.11145"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-12T04:33:19.051860Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-11T15:18:17.764452Z","title":"Large language model alignment: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.764452Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:24abfbaed3fffc79456ceb5577e881a90a44c5a97545996ed1d90a73f311e885","observation_id":"5ee5ceee-70c8-4a54-9594-ff6f9165c7e9","resolution":{"observed_at":"2026-08-11T15:18:17.764452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-10T21:51:54.603545Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-11T15:18:17.773756Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.773756Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:d947a4ee45381dfa01bc66e3e264ff4679a3d49a8a3e8e44dcc78ff542de7d4f","observation_id":"6a4a4bff-479e-4ce9-a2de-474314a45475","resolution":{"observed_at":"2026-08-11T15:18:17.773756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-11T15:18:17.778579Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.778579Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:66ac2c823bc51f791653c008aa26301f65b176c4ca14943aba1d6d3e67938d39","observation_id":"ab1c205b-8504-432f-98d1-6245523cdc74","resolution":{"observed_at":"2026-08-11T15:18:17.778579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-08-11T15:18:17.783327Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.783327Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:59e7d19308bf4bdb93018efeed50ff8693f86b2c688cbc9cf22b2cd3bbb9bd3b","observation_id":"d32a8254-b368-4624-95fa-9520e269f644","resolution":{"observed_at":"2026-08-11T15:18:17.783327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08575","last_updated":"2018-10-19T16:30:48Z","snapshot_observed_at":"2026-08-04T21:33:05.702276Z","submitted_at":"2018-10-19T16:30:48Z","title":"Supervising strong learners by amplifying weak experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08575","snapshot_observed_at":"2026-08-11T15:18:17.788272Z","title":"Supervising strong learners by amplifying weak experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.788272Z"},"links":{"cited_paper":"/paper/1810.08575","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:693e9ecb422ee46a90bad77ea027b8d1d76b61ce5a1fbbd2ce723d16bd705f0b","observation_id":"16b50d46-0267-4805-a866-16ef8e1779be","resolution":{"observed_at":"2026-08-11T15:18:17.788272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-11T15:18:17.792623Z","title":"24 Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, and Shane Legg","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.792623Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:96fe5212dca2c0cc4274e46c507d17b5ab738fb88a1cad7694b4a63f4c2cd519","observation_id":"a28e9c60-0409-4a0e-ade6-96397527604a","resolution":{"observed_at":"2026-08-11T15:18:17.792623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-11T15:18:17.796886Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.796886Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:81c1e507d8e51fb9df8d12b151e538c91013a46465d6f854392682866b58e330","observation_id":"4f0ea86e-646b-42c1-8dd0-c87bb1a3d15c","resolution":{"observed_at":"2026-08-11T15:18:17.796886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-02T15:33:17.783178Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-11T15:18:17.801169Z","title":"Improving factuality and reasoning in language models through multiagent debate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.801169Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:3e8f15d210204613e552c07356dd13d506620e1b7262f21f6bfc293f7be5f7dc","observation_id":"3dd39d37-f285-4817-9a59-e0666b752e76","resolution":{"observed_at":"2026-08-11T15:18:17.801169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T15:18:17.810199Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.810199Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:d075761f92e5ede344041184eb127c23a1fde0884a683d9851aeb1f90eadff24","observation_id":"59ef8334-a65e-445d-b030-20965e2b20c8","resolution":{"observed_at":"2026-08-11T15:18:17.810199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-12T23:32:25.133777Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-11T15:18:17.820149Z","title":"35 Nat McAleese, Rai Michael Pokorny, Juan Felipe Ceron Uribe, Evgenia Nitishinskaya, Maja Trebacz, and Jan Leike","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.820149Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:5e02aa7b05e0b6398eaa8ee9c7b8e9614f36c49d142ccd0fa01a1ac4d3c5b887","observation_id":"b66629ff-e189-4614-bdf9-3f3a95ab5386","resolution":{"observed_at":"2026-08-11T15:18:17.820149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-12T22:56:24.326978Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-11T15:18:17.824191Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.824191Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:b4d62be3b0f4335857564845b0c5d9464be7d2e3827f2cfad4394b2a3b2f3416","observation_id":"2c67b252-b1f5-4a07-bc7a-bbc985a2c63a","resolution":{"observed_at":"2026-08-11T15:18:17.824191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.289209Z","title":"AutoDetect: Towards a unified framework for automated weakness detection in large language models","venue":null,"work_id":"3cdd7eb4-ca83-4e56-bbb8-d524c6326960","year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.829537Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:12e73ca703b8bd6a1aa1e2236f3ee5e4b0f29f094cd1836e92ffbc6489233862","observation_id":"2708c8af-192b-4a68-93db-24b239e5a1e5","resolution":{"observed_at":"2026-08-11T15:18:18.293578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-08-12T22:41:40.427364Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-08-11T15:18:17.834330Z","title":"Language models learn to mislead humans via rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.834330Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:cf89c98cd68aeed41de70e10194c489cc72c884bc3564c6913b1198136d0ee73","observation_id":"ecd67083-f9ee-4f72-baab-447e193754a4","resolution":{"observed_at":"2026-08-11T15:18:17.834330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-11T15:18:17.838574Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.838574Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:32d15d3cb048a19869e7fc3711834179421044b29303628db45d939a943b7b18","observation_id":"1047eca7-37bc-493c-b977-30c9fb9dcd0b","resolution":{"observed_at":"2026-08-11T15:18:17.838574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.274489Z","title":"Unveiling the implicit toxicity in large language models","venue":null,"work_id":"aaf902e7-12ea-4312-9e94-f2a86f3e8ea6","year":2023},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.842695Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:dcd075a2382e5e57f3767f3a95f13713f9a97dffd76306172788b9a77a24b559","observation_id":"2db461c9-03b7-44bb-9755-b95547d1b5d9","resolution":{"observed_at":"2026-08-11T15:18:18.279193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20850","last_updated":"2024-10-18T15:43:02Z","snapshot_observed_at":"2026-08-12T23:53:29.540423Z","submitted_at":"2024-05-31T14:33:07Z","title":"Improving Reward Models with Synthetic Critiques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20850","snapshot_observed_at":"2026-08-11T15:18:17.846870Z","title":"45 Zihuiwen Ye, Fraser Greenlee-Scott, Max Bartolo, Phil Blunsom, Jon Ander Campos, and Matthias Gall´ e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.846870Z"},"links":{"cited_paper":"/paper/2405.20850","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:fb8d74fc1bda43fd84db298397332459b10126f53c82cb9fc7088e862e64efcb","observation_id":"2d76fa22-507b-429e-a715-bcfd64e27215","resolution":{"observed_at":"2026-08-11T15:18:17.846870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14328","last_updated":"2025-02-24T06:26:55Z","snapshot_observed_at":"2026-08-12T14:56:24.859703Z","submitted_at":"2023-08-28T06:15:14Z","title":"Reinforcement Learning for Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14328","snapshot_observed_at":"2026-08-11T15:18:17.851686Z","title":"Reinforcement learning for generative ai: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.851686Z"},"links":{"cited_paper":"/paper/2308.14328","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:183b8c54740eb40cffc86b8c124bac27d1640fefcab5313c93b4491f6757ffec","observation_id":"d9196234-2fa9-4c5c-9a18-9db170704218","resolution":{"observed_at":"2026-08-11T15:18:17.851686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.260656Z","title":"Learning to refine with fine-grained natural language feedback","venue":null,"work_id":"58adb4cc-2850-4427-b2c1-5032db34aca2","year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.856738Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:2b011274b11af1d05b0c90e50a8c8835a36da09d608d4b28948480bca7987e6d","observation_id":"c6b3b56d-02ac-4c2f-a0a9-7bef81be63a4","resolution":{"observed_at":"2026-08-11T15:18:18.265397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18359","last_updated":"2025-06-01T05:27:41Z","snapshot_observed_at":"2026-08-12T22:16:18.102829Z","submitted_at":"2024-10-24T01:41:02Z","title":"Improving Model Factuality with Fine-grained Critique-based Evaluator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18359","snapshot_observed_at":"2026-08-11T15:18:17.860973Z","title":"48 Yiqing Xie, Wenxuan Zhou, Pradyot Prakash, Di Jin, Yuning Mao, Quintin Fettes, Arya Talebzadeh, Sinong Wang, Han Fang, Carolyn Rose, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.860973Z"},"links":{"cited_paper":"/paper/2410.18359","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:3688880479207704418908ff8d38a35a30a3838c026f9e568650c12471429535","observation_id":"81eac04b-19eb-454d-b5f6-73eb1e5e90f8","resolution":{"observed_at":"2026-08-11T15:18:17.860973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.247330Z","title":"Bayesian calibration of win rate estimation with LLM evaluators","venue":null,"work_id":"b136b354-1a31-429f-9789-3a7bfed53cd2","year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.864978Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:4ac7c3ff7c807ae302e6e1c3f6ae3423785983fdc9bbfb3a31c2f43854bafe3c","observation_id":"5db97a81-6283-4170-99ba-26eda00bbc34","resolution":{"observed_at":"2026-08-11T15:18:18.251679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18370","last_updated":"2024-07-25T20:04:59Z","snapshot_observed_at":"2026-08-12T23:14:34.174205Z","submitted_at":"2024-07-25T20:04:59Z","title":"Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18370","snapshot_observed_at":"2026-08-11T15:18:17.868903Z","title":"51 Jaehun Jung, Faeze Brahman, and Yejin Choi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.868903Z"},"links":{"cited_paper":"/paper/2407.18370","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:d7ef9feb7a943f3d656ad38766a03d9c0c77ea5eb284e721a3c56a89ac1a1be0","observation_id":"717fbb25-ced1-4ed4-b551-15a149fe3a90","resolution":{"observed_at":"2026-08-11T15:18:17.868903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-06T12:42:08.815092Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-11T15:18:17.873601Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.873601Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:f609fc4210682bea3ce23999cdd44b902e9b8c1d7bd0a380f31c8862be837180","observation_id":"dfbecd98-f46b-4f7b-92fb-2dc7d38a88b7","resolution":{"observed_at":"2026-08-11T15:18:17.873601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-11T15:18:17.877823Z","title":"Self-critiquing models for assisting human evaluators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.877823Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:9628ba4e479c040d8a4b53c818de689b3d10b90915ac55f3e85edc4a1297ace3","observation_id":"f631249e-2027-428f-a169-0f54032ef4b2","resolution":{"observed_at":"2026-08-11T15:18:17.877823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:18:18.231894Z","title":"Lm vs lm: Detecting factual errors via cross examination","venue":null,"work_id":"a1e73b5b-c4e6-4ce6-b67c-e5986bd16940","year":2023},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.882052Z"},"links":{"citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:6a8b35b39a33fe6bd21b348c63e566773ad60f2029afa904a7e0dbd6f0f711a2","observation_id":"d28700c0-7ecd-4477-8c5e-6f7da6145206","resolution":{"observed_at":"2026-08-11T15:18:18.237875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02030","last_updated":"2024-05-23T13:49:25Z","snapshot_observed_at":"2026-08-13T04:27:54.307167Z","submitted_at":"2024-02-03T05:01:04Z","title":"Panacea: Pareto Alignment via Preference Adaptation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02030","snapshot_observed_at":"2026-08-11T15:18:17.886907Z","title":"Panacea: Pareto alignment via preference adaptation for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.886907Z"},"links":{"cited_paper":"/paper/2402.02030","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:bd06b313ffcfb41fdfef6cc6d1782998e8f083fc7b82d0e0d2596b56c33dc6ff","observation_id":"9b7f6cc6-638b-4e6f-8427-d88ade9038f5","resolution":{"observed_at":"2026-08-11T15:18:17.886907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T15:18:17.815334Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.815334Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:e725b4c49bf5da3bafb0c40027c5ecbaa06ad0fb2fc6101ac822b70844f57323","observation_id":"9c2a3476-5879-499e-9109-0c8b9ff6b1a9","resolution":{"observed_at":"2026-08-11T15:18:17.815334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T15:18:17.753976Z","title":"A survey of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.753976Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:8964792deeb4417694ef4b9ebc5d521360b4c24e149c63a77263239daaa8425b","observation_id":"5c7ea3fc-7624-491e-8f72-99b0ad5f281e","resolution":{"observed_at":"2026-08-11T15:18:17.753976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T15:18:17.768904Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.768904Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:327481431a361e67a707ed99bb364460b44808b7212a9ae7cb0be1695171efae","observation_id":"b6ced059-cdeb-46d0-bcca-3f7ffa1b1e4b","resolution":{"observed_at":"2026-08-11T15:18:17.768904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-08T14:17:44.034837Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-11T15:18:17.759688Z","title":"Model evaluation for extreme risks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.759688Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:6628e823678eac184d5c945e9e97a134ff3c9f3c16953959d31ad7d3f2ff80fb","observation_id":"9719a814-22c5-47cf-b1ad-ab859268a7d5","resolution":{"observed_at":"2026-08-11T15:18:17.759688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2412.11145."}