{"as_of":"2026-08-13T04:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4268bf0699ae01c0d42fe32b1a6e57f44c57968993f877f939ec688e137410eb","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:40:18.315140Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15906/citation-record","integrity":"/paper/2507.15906/integrity","json":"/paper/2507.15906/citation-record.json","paper":"/paper/2507.15906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:21.075814Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"d3e2d548-c2ea-4516-89f8-5ea9138c97db","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.176395Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:76c156900a2e501cbbe2de98b92b82e2b00dd15c377a1a7780d0b82f10f61a44","observation_id":"d809cf6f-ee7c-4ffd-892d-e7588102b78c","resolution":{"observed_at":"2026-08-06T15:40:21.156461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:40:13.266168Z","title":"The llama 3 herd of models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.266168Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b0dcbf122750b7b04b4220be32ab84e6dd6ad699f055bc8c2b31424a6835d21a","observation_id":"47697553-f704-4bb3-82e3-bfc825ef34c7","resolution":{"observed_at":"2026-08-06T15:40:13.266168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T15:40:13.333386Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.333386Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:e83fad71f6d416d131dd389343240ee5ba2ecf496f5cfb37c0545bd913e5a78a","observation_id":"ee77b394-d87e-49f6-8280-3c14d712c9cb","resolution":{"observed_at":"2026-08-06T15:40:13.333386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T15:40:13.417979Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.417979Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:bf781b77b82de7cd2a8574aaab4095a203a324a47ab034df9e4fe6cb840b2147","observation_id":"fbb27280-7859-4c32-8d4f-a42d30e3c2f0","resolution":{"observed_at":"2026-08-06T15:40:13.417979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T15:40:13.494528Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.494528Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:9ed7d23db408789af5f87fdde176ae95a1d92a5e9386d3c97cfe72637ad189df","observation_id":"48ae5dfa-eb9f-465e-aa15-b6cc4542ab59","resolution":{"observed_at":"2026-08-06T15:40:13.494528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:13.621778Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.621778Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:63e8f9a6414e9e9ab835818402b2dfa4ec835b40ab43fdb0852b914ae7c55613","observation_id":"1728c136-ef99-4e4d-a6ff-0be5e299c464","resolution":{"observed_at":"2026-08-06T15:40:13.621778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T15:40:13.721341Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.721341Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:2b9c4d3a399f64144e2fe255d923a8c565cdc034b266ced3eb3bb8dd24629f0f","observation_id":"d81661bf-1992-4d60-91f9-a40889259d1e","resolution":{"observed_at":"2026-08-06T15:40:13.721341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-06T15:40:13.818475Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.818475Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:0f5516449c24edb50f1470717da974769978292d66595082ebacea9e57631771","observation_id":"08da191c-c502-4312-bed6-4226835d001c","resolution":{"observed_at":"2026-08-06T15:40:13.818475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.858766Z","title":"Suphavadeeprasit","venue":null,"work_id":"797dfc65-a426-4822-9c6d-dd1705ffe518","year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.865665Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:dc2cefcd62102ac6229bfa871a0faf29681e9eb99f51ed8192c5321f46d0206f","observation_id":"1d279d30-0dcf-4f19-bfaa-89c952a0a89f","resolution":{"observed_at":"2026-08-06T15:40:20.952919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.711452Z","title":"Gemini 2.0 flash: Next-generation multimodal ai model","venue":null,"work_id":"845ae6fd-3823-4ab1-82cd-b49a06b22d33","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.944596Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:4a08d8eea8d973676f222d8cf25aa68eef128ac612cd94b67e971300c5defa6a","observation_id":"5e10c0f0-fb17-4bfe-9a8f-44419e76630c","resolution":{"observed_at":"2026-08-06T15:40:20.783795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T15:40:14.010645Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.010645Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:4b8f26001603d23b6512e6de4db7631cd649a274e7ced3c2771104a49de1e5b3","observation_id":"1361e871-f6d0-4c4d-9c6c-b5e0025049e2","resolution":{"observed_at":"2026-08-06T15:40:14.010645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:14.132426Z","title":"RAFT : Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.132426Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:c7a0bbafe9d12d69e0de9a52e97491d3f6e76f21f9f01909a89a5e2891fb0358","observation_id":"97e0d881-e718-487f-a5bb-1e108dcacce4","resolution":{"observed_at":"2026-08-06T15:40:14.132426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-12T08:12:44.293962Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-06T15:40:14.208038Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.208038Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:7bf0bb8415d3d69bfd98d5f6432802755864f5be299a2df9f7319f723ffd9a59","observation_id":"e91f2dfc-d7f7-4e9b-8792-7f4fef976c8f","resolution":{"observed_at":"2026-08-06T15:40:14.208038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T15:40:14.278132Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.278132Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:c96bf936afceda08961a3de7e92954927b727b2e590f50c00006fa47755c4569","observation_id":"d2b52343-ad36-4d03-85ab-8d46ab45da4f","resolution":{"observed_at":"2026-08-06T15:40:14.278132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.493973Z","title":"Understanding dataset difficulty with v-usable information","venue":null,"work_id":"6808699d-3af0-433f-8ad0-1b173022aa0f","year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.350372Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:7424c2aed06e7e16b3b9faba5b63793ef3caa2d87bf11bece7b59a943942f864","observation_id":"0e5c7de4-926c-4d9f-8825-509c26dcdb16","resolution":{"observed_at":"2026-08-06T15:40:20.612471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.310809Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":"a8659636-f5b3-47e8-b17f-33008fdb2fba","year":2016},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.467970Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b692939de2ac4d677a183adc17b229faea571b9ff079f5b85e586d72a2cd2ece","observation_id":"cd467f85-11b8-4976-a8fe-6efab80bbead","resolution":{"observed_at":"2026-08-06T15:40:20.401191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:14.648398Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.648398Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:c2f95d8aabe335cdc9095c5a7b973e13b36f3aa18b9c65fc0632ca6a47121bfe","observation_id":"4115c2db-0a6e-4527-b18e-31c2da76f903","resolution":{"observed_at":"2026-08-06T15:40:14.648398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.154837Z","title":"https://huggingface.co/google/gemma-2b, 2024","venue":null,"work_id":"a8120e27-49c4-45e0-8fe8-ddab996b81de","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.807037Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:89578679487fc6f85fb49496e5e99c119cbb3adaeec29597f6f5ccdca73c5c17","observation_id":"8f8c4ae2-e1e8-4d32-b9a1-69738b2f53c3","resolution":{"observed_at":"2026-08-06T15:40:20.250009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:14.973348Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.973348Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:a7e129e99056ad5483bf53ac27f62fedd9ccd631b2a7e500ed9b3f53ef9dd8a8","observation_id":"1dc032e9-a02f-4dce-b96d-6b068474f4da","resolution":{"observed_at":"2026-08-06T15:40:14.973348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T15:40:15.092213Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.092213Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:e5473b64df1108e1ea9a6c300f4bbc9f9cbb3eb2386e91ec94bbbc02825dfcdb","observation_id":"0130163d-ee01-4d80-8e01-84e6c0938b5b","resolution":{"observed_at":"2026-08-06T15:40:15.092213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-11T16:00:06.021847Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T15:40:15.257918Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.257918Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b2fc2d0ea642a1c3e56d517cef5e7223cd0d7daa86216c18ddf634f369429fd8","observation_id":"33e0d3f5-5f7a-4d3d-a8d7-a3ec2544814f","resolution":{"observed_at":"2026-08-06T15:40:15.257918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T15:40:15.368188Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.368188Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:5731499a412878fc6df8fa003a381d89d3ddb797becaa35bfd2b95a9474b69b5","observation_id":"61587e0a-0251-4e40-b1ba-8cc8fee53523","resolution":{"observed_at":"2026-08-06T15:40:15.368188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:15.487856Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.487856Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b774cfc3085f5c2f6467508b671ffe3a2ea8f54c050ffb854c18b3249c9a0b74","observation_id":"24b201b5-75dd-4e28-9733-9bee5051bfbc","resolution":{"observed_at":"2026-08-06T15:40:15.487856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.941203Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces, 2023","venue":null,"work_id":"078bcf8e-d236-4184-bd6a-d5b977c5b80f","year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.623570Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:a060fe573128a05055942f6c5a6b0ea24e05c0631280b00b0be8b22ab2c42eb7","observation_id":"6f0b80df-145c-4ef6-af21-d3a6aedfcba2","resolution":{"observed_at":"2026-08-06T15:40:20.024665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12401","last_updated":"2022-05-24T23:22:10Z","snapshot_observed_at":"2026-08-11T13:30:57.643853Z","submitted_at":"2022-05-24T23:22:10Z","title":"Reward Uncertainty for Exploration in Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12401","snapshot_observed_at":"2026-08-06T15:40:15.689847Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.689847Z"},"links":{"cited_paper":"/paper/2205.12401","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:115356b6b86d0e058d7cecd93313723996d777d6de2c97bfda460302ad7f453b","observation_id":"1544c899-73e4-4a7b-9a41-91ea72ae8d17","resolution":{"observed_at":"2026-08-06T15:40:15.689847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.778889Z","title":"Iterative prompting for estimating epistemic uncertainty","venue":null,"work_id":"6bf6a4ed-8ebc-4890-b814-20bd397779e2","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.762639Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:f225883dfa08c3f1ea16f33be2d724b696ec3b897aba46848bf33b4e2996c7d8","observation_id":"0babacde-4ada-4f0a-adcc-94e46862e9e8","resolution":{"observed_at":"2026-08-06T15:40:19.849773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-08-12T22:33:14.632545Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-06T15:40:15.880022Z","title":"Uncertainty-aware reward model: Teaching reward models to know what is unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.880022Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:aeaa27a9d1daa3eb48eb39ea7e320459aaee4d71de6ec421f38499747f4d6d3a","observation_id":"902799f6-fb92-4983-98a6-59f7a3fff674","resolution":{"observed_at":"2026-08-06T15:40:15.880022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:15.957662Z","title":"Introducing meta llama 3: The most capable openly available llm to date","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.957662Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:5b45c8212b20adabd58b1fb70a2099ff9e1ec1a1405b297079088cf03c35451b","observation_id":"28c4d9ce-4dcc-4d52-85c6-fc6d793041e9","resolution":{"observed_at":"2026-08-06T15:40:15.957662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.534395Z","title":"Montgomery and George C","venue":null,"work_id":"46f29af5-c867-4db4-8182-0e107dd06bad","year":2014},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.020519Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:5399537b7baa9e79814377c72b160bbf980058e50d73436a856bfa3a3d3ee38d","observation_id":"e439b574-48dd-419d-a3bb-64f9c38ba7af","resolution":{"observed_at":"2026-08-06T15:40:19.638664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:40:16.098615Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.098615Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:0a3e61f1389f313b1f70757743b0788f518e87ece8d837137343fa3b8fa41222","observation_id":"757574e9-7c31-43a4-abd1-614f6e78f258","resolution":{"observed_at":"2026-08-06T15:40:16.098615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.193548Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.193548Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:c288a31672e7723d07713f6c72f2cedd6512df9d6379aad6777c9470781f0b8c","observation_id":"91246783-23e2-48a4-8de0-3e8e6fa149ca","resolution":{"observed_at":"2026-08-06T15:40:16.193548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.285137Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.285137Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:e09eeee6593b0fa2f1e63828f8cd352b18ab04798b3a247297a4af15a9dedf7e","observation_id":"18c522b9-122d-4a4a-adbd-92b17f02a131","resolution":{"observed_at":"2026-08-06T15:40:16.285137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.368788Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.368788Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:eb48e8e050a2e1a8e68c2cd5c513397b7e6e9e4fff8e89c312a1405ad9090835","observation_id":"57c3ab16-89df-48eb-a27d-8adab523beee","resolution":{"observed_at":"2026-08-06T15:40:16.368788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T15:40:16.470462Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.470462Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:1c31aa0ed7e46c2ca5d09adc3a6dee63633eba05190b938f03f056ad1cf43ab1","observation_id":"5650bcbd-ea5c-4a08-9b87-388f4fe98063","resolution":{"observed_at":"2026-08-06T15:40:16.470462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-06T15:40:16.538614Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.538614Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:26e8c40ad10a45f396d0e8809de14a3d6e9b20989bc4751dc13a2f4a7ca5a8e4","observation_id":"9b210cb0-f49a-48d1-aea4-6c6df8c36850","resolution":{"observed_at":"2026-08-06T15:40:16.538614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:40:16.600627Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.600627Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:9fc28cd86a6eb0acc12582fcda427d5963ea8018d6ce408a0cb92be70377a23b","observation_id":"58d43223-87e6-472e-b055-18d7a48a7cdb","resolution":{"observed_at":"2026-08-06T15:40:16.600627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.317341Z","title":"Mutual fund performance","venue":null,"work_id":"77b3e3e9-0e6d-4d40-baaf-424f69fab193","year":1966},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.680687Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:f90bf2f9015f9ef42ada3e732c6cacc3a97fd1e1da3fd807612ab05b53c01efd","observation_id":"98871c98-ad6d-461e-90d4-40083a555d8e","resolution":{"observed_at":"2026-08-06T15:40:19.401125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.751394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.751394Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:3a0fdcbb638cd3599b04236cdaf426bb46a52096519d7b1823f388fcf3418415","observation_id":"a399d956-22d0-4734-b28b-5c7ad4a851cb","resolution":{"observed_at":"2026-08-06T15:40:16.751394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11239","last_updated":"2024-10-02T11:07:14Z","snapshot_observed_at":"2026-08-12T22:43:10.459020Z","submitted_at":"2024-09-17T14:40:02Z","title":"LLM-as-a-Judge & Reward Model: What They Can and Cannot Do","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11239","snapshot_observed_at":"2026-08-06T15:40:16.846785Z","title":"Llm-as-a-judge & reward model: What they can and cannot do, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.846785Z"},"links":{"cited_paper":"/paper/2409.11239","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:dda0f52c5a2b9675b3a68980eefbc75f7903f56ffc46dc11024e912d2db667fa","observation_id":"9aeebd62-11a7-44fa-94b3-9d09552a9746","resolution":{"observed_at":"2026-08-06T15:40:16.846785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.908542Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.908542Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:e4c44fcf0175d0bbcbef45608f7984c2caca63d2738b5fa93739461981dcfc86","observation_id":"cc34c0a9-eb6a-439b-851c-fc50b32b7883","resolution":{"observed_at":"2026-08-06T15:40:16.908542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.999910Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.999910Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:705f8a0a8cf846dd7fb729ed64b2cfe455caa688918ad4da5fd0a7f45e4605bc","observation_id":"362f149e-6940-42e8-8316-2a92bb0a8b50","resolution":{"observed_at":"2026-08-06T15:40:16.999910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03533","last_updated":"2023-11-06T21:14:40Z","snapshot_observed_at":"2026-08-10T09:36:09.330845Z","submitted_at":"2023-11-06T21:14:40Z","title":"Quantifying Uncertainty in Natural Language Explanations of Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.03533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.03533","snapshot_observed_at":"2026-08-06T15:40:18.584627Z","title":"Quantifying Uncertainty in Natural Language Explanations of Large Language Models","venue":"cs.CL","work_id":"29d622c3-14d1-4804-8a56-66c8051a08f0","year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.037690Z"},"links":{"cited_paper":"/paper/2311.03533","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:5fe27aa6ac8d05aa7fc6acc0363a5145ec439ca142d081a065f61671613792f5","observation_id":"b75730e9-da5d-469a-ad94-d67b210d359e","resolution":{"observed_at":"2026-08-06T15:40:18.689752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T15:40:17.125727Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.125727Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:74b178b2f2f05ba7860a4636937b8225bf2ea4b780da8ca818442bd07abbc3b2","observation_id":"99d1eca3-0d57-44c2-89f2-f0e50ca4e355","resolution":{"observed_at":"2026-08-06T15:40:17.125727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T15:40:17.194495Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.194495Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:54abc3e094a867548906e9b0168ba11f885f58280f392b7ae12bfb0f5d5b0cd8","observation_id":"6b251672-a983-4cec-8bd6-84eb6017d14b","resolution":{"observed_at":"2026-08-06T15:40:17.194495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T15:40:17.315138Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.315138Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:1d98b51783026b1504ae3a15bbadfe2bbf1267fe3ebe2a68a168d566acaa230c","observation_id":"8d6d2705-1af5-4aef-a24c-771fdf608aa3","resolution":{"observed_at":"2026-08-06T15:40:17.315138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:40:17.350383Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.350383Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:05cb4aedc1c07f301b56b4d4c7327f08409e09e07b7c38c54bb0fdf150615f07","observation_id":"4b7ec90c-cf1c-40a0-b378-fd8e214e9552","resolution":{"observed_at":"2026-08-06T15:40:17.350383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:17.443886Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.443886Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:78aa22661839c958125b09d1d36fc8bc0bbefa7910e80a57cc806033fa245514","observation_id":"98e4ed2e-64d5-47b2-b840-901b19b509cf","resolution":{"observed_at":"2026-08-06T15:40:17.443886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-08-12T12:00:38.540612Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-06T15:40:17.507422Z","title":"Helpsteer: Multi-attribute helpfulness dataset for steerlm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.507422Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:3d629212c4bea07017a07c5247f05102275a3762eea69c5337ddb53e38f686f0","observation_id":"c8a35bd8-9eeb-4310-b713-fbe3f304dbc7","resolution":{"observed_at":"2026-08-06T15:40:17.507422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:17.562762Z","title":null,"venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.562762Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:1670b436a713c9e4689fe94000a480a4116113b451e8cbb84c97ebcad4703afa","observation_id":"91d61d80-9a94-43c0-bbbd-640ab06fd754","resolution":{"observed_at":"2026-08-06T15:40:17.562762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:17.663383Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.663383Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:be6f423334165ea794ae86ea368749575c64fe295d2fa4ad1c604548bd72b657","observation_id":"d0847c30-0dc7-4bb2-b24e-876bd2a7af18","resolution":{"observed_at":"2026-08-06T15:40:17.663383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-06T15:40:17.718260Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.718260Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:6c895244fb619d183c95b0f34aa71c2df035fe849ba8702c0f5dc4e2537e8f76","observation_id":"86902715-0dcf-4e6c-ac7e-5e21f4300593","resolution":{"observed_at":"2026-08-06T15:40:17.718260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.111937Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"44b55589-8dce-438c-9f50-2a7470e7091b","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.830385Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:42338a3b43ee9e3b9b73931f2486c6f134710b04cfed0e6f2a86a5bff2e2040d","observation_id":"b9e8f8b0-26ef-4a1d-ab22-ede3d8ba02d1","resolution":{"observed_at":"2026-08-06T15:40:19.197653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T15:40:17.864241Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.864241Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:7be285ed43931a3614da5857b7eddb5ac8500cd00f059bb22e78b55ef4a1efb1","observation_id":"9624b5bf-a1d1-4fa5-8d09-f4b118e216e4","resolution":{"observed_at":"2026-08-06T15:40:17.864241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-13T00:39:09.051530Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-06T15:40:17.967384Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.967384Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:4f1167790875f2f2da9cf30a7cc27e6aaa856b382bfaf18fe3abad140f659062","observation_id":"a0780e28-bddc-4838-9500-e3b1140c06a7","resolution":{"observed_at":"2026-08-06T15:40:17.967384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00243","last_updated":"2023-12-30T14:14:14Z","snapshot_observed_at":"2026-08-09T02:38:58.119104Z","submitted_at":"2023-12-30T14:14:14Z","title":"Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00243","snapshot_observed_at":"2026-08-06T15:40:18.065331Z","title":"Uncertainty-penalized reinforcement learning from human feedback with diverse reward lora ensembles","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.065331Z"},"links":{"cited_paper":"/paper/2401.00243","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ffce0b6bdaeed58f7d31b44ec3ba0893d5381e73d55913082c6ab99e5a82049d","observation_id":"07acfe67-c226-46b8-9be1-2d768943a270","resolution":{"observed_at":"2026-08-06T15:40:18.065331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:18.924083Z","title":"Bayesian prompt ensembles: Model uncertainty estimation for black-box large language models","venue":null,"work_id":"dcd9e6e8-36be-443c-9deb-f8df3c64fd3d","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.152809Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:8ad4f0bec1d418423b2ca16cffba5af53e20f9397d7d21d1b62a31610bff06b5","observation_id":"1cc00e7e-3488-4566-9cd4-acba6e84c90a","resolution":{"observed_at":"2026-08-06T15:40:18.999138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16635","last_updated":"2024-10-22T06:19:20Z","snapshot_observed_at":"2026-08-13T04:32:13.094522Z","submitted_at":"2024-01-30T00:17:37Z","title":"Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16635","snapshot_observed_at":"2026-08-06T15:40:18.178863Z","title":"Improving reinforcement learning from human feedback with efficient reward model ensemble","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.178863Z"},"links":{"cited_paper":"/paper/2401.16635","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ac922a4e06b4f28c7e2ca24918af9974ec36faadcdce478607baaa6e142f6a20","observation_id":"ac20c0ed-0aa3-4bb5-bf93-3e9d82819382","resolution":{"observed_at":"2026-08-06T15:40:18.178863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:18.225082Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.225082Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:3aab8ffaa4da153173efb517ceaddd25692b8ee39120534e18f0897c7d46f229","observation_id":"5790b6ad-18f7-4d2b-96cb-4127ecc14bb7","resolution":{"observed_at":"2026-08-06T15:40:18.225082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T15:40:18.315140Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.315140Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:dacf618d63c4e67f8a9a177e095a8f56d00eb21ca88ace798d2fae2daf0a1afe","observation_id":"6d9b15d1-25f5-428b-b2c2-6e41fc92c2a5","resolution":{"observed_at":"2026-08-06T15:40:18.315140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2507.15906."}