{"as_of":"2026-08-16T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fb3179bd57ae41fd1093eb9d3f198064cf5a94a945534c1dea0a008adfb0efe","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:48:02.087057Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06298/citation-record","integrity":"/paper/2506.06298/integrity","json":"/paper/2506.06298/citation-record.json","paper":"/paper/2506.06298"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.689640Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.689640Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d9e25d7449e640da2062523b09dee3407e915ed5d2c3ee42b555317cc89c7a6f","observation_id":"9cdf6fb2-6d4c-4115-b73a-32811ad29ac8","resolution":{"observed_at":"2026-08-15T20:48:01.689640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.695097Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.695097Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:c8be586418e9981d17ee5e759b01eb97b36ff0eef76487afb4fa003090fcb581","observation_id":"70ba490e-66da-4f4c-94ce-725d94732517","resolution":{"observed_at":"2026-08-15T20:48:01.695097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T20:48:01.699662Z","title":"Constitutional AI: Harmlessness from AI feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.699662Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:66962c1a7d208068c91a1df29a4e1fb9813a26e217ee13d7881259047149109b","observation_id":"7339a956-a618-4df3-a86c-75a82bd18d73","resolution":{"observed_at":"2026-08-15T20:48:01.699662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-15T20:48:01.704781Z","title":"Ethical and social risks of harm from language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.704781Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:26e6b77e1ef2e9e00e0f799295cd125bb20a5321191c77298cd67002698f454f","observation_id":"fa172a58-b6f2-454d-9fa6-f9d2ed86ca38","resolution":{"observed_at":"2026-08-15T20:48:01.704781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.709515Z","title":"Cultural palette: Pluralising culture alignment via multi-agent palette","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.709515Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8ee7721f3ef9021599aaeed86a728c8e1a0a6cd2708807b6f9400bd6cac8c1d4","observation_id":"3e94affd-2d2d-4e06-9a65-da62c82a8978","resolution":{"observed_at":"2026-08-15T20:48:01.709515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13069","last_updated":"2022-11-19T18:45:02Z","snapshot_observed_at":"2026-08-16T16:14:52.002414Z","submitted_at":"2022-11-19T18:45:02Z","title":"Cultural Incongruencies in Artificial Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13069","snapshot_observed_at":"2026-08-15T20:48:01.714150Z","title":"Cultural incongruencies in artificial intelligence","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.714150Z"},"links":{"cited_paper":"/paper/2211.13069","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:fe19c8a4a4144187170cebaa159186dbddbf3e469b72558195cd3bba30c4bc92","observation_id":"639f046c-d067-47ec-9a8f-b984512cebb2","resolution":{"observed_at":"2026-08-15T20:48:01.714150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-16T14:00:45.842560Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-15T20:48:01.719440Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.719440Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:331193d6cb460b8a1b98dbcc27aa3a6bc95a4e978172ca37fe4cfd7c26f2c8fa","observation_id":"e35e37ad-505c-43c1-8864-953fa84eed69","resolution":{"observed_at":"2026-08-15T20:48:01.719440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.724303Z","title":"The PRISM alignment dataset: What participatory, representative and individualised human feedback reveals about the subjective and multicultural alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.724303Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1311235e89265483ab4528025d2da27f1afaf58965713a6932bd5a08d90eae62","observation_id":"ce06337d-3332-4314-8b87-ac1269f7ba0a","resolution":{"observed_at":"2026-08-15T20:48:01.724303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-08-16T14:18:47.404329Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-15T20:48:01.728783Z","title":"MaxMin-RLHF: Towards equitable alignment of large language models with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.728783Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:cb80d299c0a323f39192349c06af3f9578fc55d227c661c4cd739266e200f510","observation_id":"92a32861-6fb7-4f05-a88e-408eb1c934f7","resolution":{"observed_at":"2026-08-15T20:48:01.728783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-15T20:48:01.734382Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.734382Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1ef09149aea62c88a29ddca93dfca57da86b0b4a92fdc8494e7c98c77cd6d2d9","observation_id":"5fdacdc4-d048-4817-bd2c-0e4a07642ded","resolution":{"observed_at":"2026-08-15T20:48:01.734382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.739314Z","title":"Whose opinions do language models reflect? InProceedings of the 40th In- ternational Conference on Machine Learning (ICML), pages 29971–30004, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.739314Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6ce176339e802fde206898492ed725ac891d383cf2c35679c9f1675b0592da58","observation_id":"d9f14b31-9c5f-464e-b28d-dcc493fa7fa7","resolution":{"observed_at":"2026-08-15T20:48:01.739314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-08-14T22:08:45.647927Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-15T20:48:01.743851Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.743851Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:e099e0c06400275c97cc4c76d1a0e816fce6cab15cb2cf14afa24146aafc149d","observation_id":"acf8846c-cc79-4603-b4c0-09a3af831728","resolution":{"observed_at":"2026-08-15T20:48:01.743851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05453","last_updated":"2023-03-09T17:52:07Z","snapshot_observed_at":"2026-08-16T17:49:19.639103Z","submitted_at":"2023-03-09T17:52:07Z","title":"Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05453","snapshot_observed_at":"2026-08-15T20:48:01.748505Z","title":"Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.748505Z"},"links":{"cited_paper":"/paper/2303.05453","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:58012af683b1c76f2e5abf07c8c3c071ecc1d96baa0d0a29ca7d57b8a14c57b6","observation_id":"14c9880d-6b35-4781-ba18-26cdf04987b8","resolution":{"observed_at":"2026-08-15T20:48:01.748505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.753507Z","title":"Diverse preference learning for capabilities and alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.753507Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:9283b7f11a1ed0a70d6ca64afdd34157ecd1ce2e33ea6e08539d307f3da94635","observation_id":"35151b6b-0437-41c1-849f-371af5026d5b","resolution":{"observed_at":"2026-08-15T20:48:01.753507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:48:01.757851Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.757851Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f5f3d7b177e6a60c1d646abbf18e6345e23e5a36feffe7848cf49999f4c51b88","observation_id":"3af7a9e5-cea5-48c3-8f64-16e7292dfe43","resolution":{"observed_at":"2026-08-15T20:48:01.757851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16455","last_updated":"2025-08-25T01:01:38Z","snapshot_observed_at":"2026-08-16T13:49:22.343595Z","submitted_at":"2024-05-26T07:00:05Z","title":"On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16455","snapshot_observed_at":"2026-08-15T20:48:01.762381Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.762381Z"},"links":{"cited_paper":"/paper/2405.16455","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:908cdf7dfa1e581c4dada9dcf07cf1cb1d3b0497707d9393caa391f62f12a52a","observation_id":"159f1a61-bbf6-4644-be8a-f63f2547f41a","resolution":{"observed_at":"2026-08-15T20:48:01.762381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.767496Z","title":"Evaluating the diversity and quality of LLM generated content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.767496Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8957235e21c590d0d49a8e567f574bbb7c2a8a274af648bf07acf96ce54d0aaa","observation_id":"d13e0bd2-1a64-44d7-be10-88ee55e94d7d","resolution":{"observed_at":"2026-08-15T20:48:01.767496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17692","last_updated":"2025-05-12T16:11:53Z","snapshot_observed_at":"2026-08-16T13:39:42.535044Z","submitted_at":"2024-06-25T16:32:33Z","title":"From Distributional to Overton Pluralism: Investigating Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2406.17692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17692","snapshot_observed_at":"2026-08-15T20:48:02.593491Z","title":"From Distributional to Overton Pluralism: Investigating Large Language Model Alignment","venue":"cs.CL","work_id":"8c0f7028-3141-43e0-9437-dc5e0a0dcbf1","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.771882Z"},"links":{"cited_paper":"/paper/2406.17692","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:68c08700432343c7697d075409f760c24f44372507d62045809a4d7155321211","observation_id":"2ba3f9d5-8324-4c5f-a78c-d5bb1821f2f2","resolution":{"observed_at":"2026-08-15T20:48:02.598897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-15T20:48:01.776628Z","title":"Understanding the effects of RLHF on LLM generalisation and diversity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.776628Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b4af9327470c1dc6985f12ff9182a61296b097c94c7572dbba5cc12ba46abc0e","observation_id":"68c4f98c-df94-4fab-8410-6d339079d768","resolution":{"observed_at":"2026-08-15T20:48:01.776628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.476237Z","title":"A distributional approach to con- trolled text generation","venue":null,"work_id":"8cdb47b0-3580-440e-a17c-70e5b114f33e","year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.781209Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:51713f96987c06692c62f3ff570a75aa602052da07b1f4730cf96061c37c6907","observation_id":"e10d18e0-7a0d-4760-b54c-eeff2e81da64","resolution":{"observed_at":"2026-08-15T20:48:03.481429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-15T20:48:01.785525Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.785525Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f4cc2ab38dcf8cf09d9db7355c4067f6f2f74db0a706094bfc3e70f6f2835a59","observation_id":"71fe6e7a-cebc-475c-aadb-d437e6ea5d12","resolution":{"observed_at":"2026-08-15T20:48:01.785525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15951","last_updated":"2024-10-11T00:05:03Z","snapshot_observed_at":"2026-08-16T13:40:28.103117Z","submitted_at":"2024-06-22T22:07:40Z","title":"Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15951","snapshot_observed_at":"2026-08-15T20:48:01.790093Z","title":"Modular pluralism: Pluralistic alignment via multi-LLM collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.790093Z"},"links":{"cited_paper":"/paper/2406.15951","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:678b28aa456e79cd4eeedcc5b813959eea470b2a78aa75679a19382dfabc89fa","observation_id":"4a83cf32-3f50-49fd-b428-a28cf50605b0","resolution":{"observed_at":"2026-08-15T20:48:01.790093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-08-14T17:53:51.886327Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05070","snapshot_observed_at":"2026-08-15T20:48:01.795036Z","title":"A roadmap to pluralistic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.795036Z"},"links":{"cited_paper":"/paper/2402.05070","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:5084b5d7d58fe5235bde3023351c7d5fd4a0bb450cea207b7b6606cd53fdf347","observation_id":"b9a889e0-599c-4e59-93fe-719449655e14","resolution":{"observed_at":"2026-08-15T20:48:01.795036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-16T13:56:25.795152Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-15T20:48:01.799802Z","title":"RLHF from heterogeneous feedback via personalization and preference aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.799802Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f5e4e81202b65656a8e3124f70f050fdfdfec969b04d672d88d2eeeba978afb8","observation_id":"9afab7f9-7422-4192-9331-2eaeca87a3f1","resolution":{"observed_at":"2026-08-15T20:48:01.799802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.460766Z","title":"Pal: Pluralistic align- ment framework for learning from heterogeneous preferences","venue":null,"work_id":"44a5a4c0-44c2-46ef-b77a-c6737118c342","year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.804641Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f92119208fb064a6c38f0510ff449ccc425fc438d02f8c895065127ad2bf339f","observation_id":"4f8c0b98-8283-40b6-9c97-c04c0b0df8ff","resolution":{"observed_at":"2026-08-15T20:48:03.465858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.809500Z","title":"Value profiles for encoding human variation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.809500Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d20fe977d3cbd98824ee43caebccb4e2ca2e9510901a3e58d2ff77aae2ff509f","observation_id":"63db3e0f-edad-4f23-b2da-10a5d65cdd18","resolution":{"observed_at":"2026-08-15T20:48:01.809500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.445937Z","title":"Aligning language models to user opinions","venue":null,"work_id":"0d24e6b7-742d-402d-a671-97b29957d3e6","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.814140Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:fc4162006b4714a38a0feaf16beb86d719b82f46a751b88167f8f557fdf6761c","observation_id":"86f24656-82b8-4d5b-a69d-ab27df243774","resolution":{"observed_at":"2026-08-15T20:48:03.450858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17387","last_updated":"2024-07-24T16:11:39Z","snapshot_observed_at":"2026-08-16T13:31:22.334408Z","submitted_at":"2024-07-24T16:11:39Z","title":"PERSONA: A Reproducible Testbed for Pluralistic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17387","snapshot_observed_at":"2026-08-15T20:48:01.818699Z","title":"Persona: A reproducible testbed for pluralistic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.818699Z"},"links":{"cited_paper":"/paper/2407.17387","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:60369023086a63755b9eb206da8dbbccb77e3d4f27dbaf395016a49dfe5ef69f","observation_id":"a0784958-be4e-4247-9404-df337da1a635","resolution":{"observed_at":"2026-08-15T20:48:01.818699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.429928Z","title":"Position: Social choice should guide AI alignment in dealing with diverse human feedback","venue":null,"work_id":"974402ed-8b1b-425d-8460-ebe9e568adbc","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.823584Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6407e6ac322ede7531f838b70f689bb1406a4e8623c6a067c6c65e2eb00b6b90","observation_id":"698c0fc2-e1ef-4d14-99e0-89377ea61f82","resolution":{"observed_at":"2026-08-15T20:48:03.435220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16048","last_updated":"2023-10-24T17:59:04Z","snapshot_observed_at":"2026-08-16T14:49:14.404796Z","submitted_at":"2023-10-24T17:59:04Z","title":"AI Alignment and Social Choice: Fundamental Limitations and Policy Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16048","snapshot_observed_at":"2026-08-15T20:48:01.828061Z","title":"Ai alignment and social choice: Fundamental limitations and policy implica- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.828061Z"},"links":{"cited_paper":"/paper/2310.16048","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:79f254969a4c45d98f2f718e99ef450b98aaa85766ce83b2b0fab10c5b74bd04","observation_id":"86a81d0f-acb5-4f2f-a64a-521805225db2","resolution":{"observed_at":"2026-08-15T20:48:01.828061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.414729Z","title":"Rewarded soups: towards Pareto-optimal alignment by inter- polating weights fine-tuned on diverse rewards","venue":null,"work_id":"5b269518-ddfd-46e3-9f56-a3287c2ddc26","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.832779Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7c2b04ba3c4171b458b66b97866782c5ff36d835db84128481f62d59dc7b589f","observation_id":"56eddf10-da18-4237-864c-a12fde9743d9","resolution":{"observed_at":"2026-08-15T20:48:03.419841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.399537Z","title":"Axioms for AI alignment from human feedback","venue":null,"work_id":"06d5b050-d902-4aed-a65a-a4f641c59c77","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.837286Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:788d16ecef1682f09c3731420d60a55cf6c763150f13d1ccf9229a65a89baeee","observation_id":"ae4a6ea4-8b0c-47e2-8838-33d4382ea6f5","resolution":{"observed_at":"2026-08-15T20:48:03.404613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14953","last_updated":"2025-04-17T18:52:54Z","snapshot_observed_at":"2026-08-16T13:50:02.540059Z","submitted_at":"2024-05-23T18:01:11Z","title":"MallowsPO: Fine-Tune Your LLM with Preference Dispersions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14953","snapshot_observed_at":"2026-08-15T20:48:01.841780Z","title":"Mallowspo: Fine- tune your LLM with preference dispersions.arXiv preprint arXiv:2405.14953, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.841780Z"},"links":{"cited_paper":"/paper/2405.14953","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1f732260c8048be9ae3aa7b3cd69a4b23dbe97fece82eefe0fc24dda64492532","observation_id":"29803dee-02c0-4edb-9639-44868b298edc","resolution":{"observed_at":"2026-08-15T20:48:01.841780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.384673Z","title":"Adaptive preference scaling for reinforcement learning with human feedback.Advances in Neural Information Processing Systems, 37:107249–107269, 2024","venue":null,"work_id":"9f23994a-8558-4976-801e-3b4fccf16ec4","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.847004Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:ff3428c3287eff7f36c0e5fb555aac5ee693d064deecf20fecd1bb6b05eed569","observation_id":"785ee3d6-2cdb-4148-ae12-22e73a41099a","resolution":{"observed_at":"2026-08-15T20:48:03.389516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.369487Z","title":"Aligning language models with human preferences via a Bayesian approach.Advances in Neural Information Processing Systems, 36:49113–49132, 2023","venue":null,"work_id":"ba0e9aa9-2a22-49bb-ac9b-89ee63eab54f","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.851648Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:312ec5ed1a71dc7cc8fbc049e28573ef2923ea4585f91a73af029472d6b6de59","observation_id":"75bbd463-a625-4d0f-9820-c32a7ecf21a8","resolution":{"observed_at":"2026-08-15T20:48:03.375202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-08-16T13:25:29.397694Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-15T20:48:01.856173Z","title":"Personal- izing reinforcement learning from human feedback with variational preference learning.arXiv preprint arXiv:2408.10075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.856173Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:bb5fa434aaa98ea0904ce5c52e962bff166661084ec8314ea5421030f528d5a4","observation_id":"03485a93-87f0-4c0d-9417-abe1c126be11","resolution":{"observed_at":"2026-08-15T20:48:01.856173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16320","last_updated":"2025-02-22T18:46:33Z","snapshot_observed_at":"2026-08-16T12:56:04.263475Z","submitted_at":"2025-02-22T18:46:33Z","title":"Direct Alignment with Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16320","snapshot_observed_at":"2026-08-15T20:48:01.861096Z","title":"Direct alignment with heterogeneous preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.861096Z"},"links":{"cited_paper":"/paper/2502.16320","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1500ebd8de0f54b15b5bf6fb949812ca93e09a7b808d826db6c84fb058867324","observation_id":"6dab271b-b97c-45a1-9e9e-b1aaac5e938e","resolution":{"observed_at":"2026-08-15T20:48:01.861096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.354544Z","title":"Distributional preference learning: Understanding and accounting for hidden context in RLHF","venue":null,"work_id":"ba5fb72f-4ecd-4194-9687-0f6063ad49cd","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.865792Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:79cf0d197ed37bf71697a705d99cf34ec2f01f7406cb2dfc90e86633b95e217e","observation_id":"49435cce-d04d-408b-81a5-bc3dc7da52f0","resolution":{"observed_at":"2026-08-15T20:48:03.359673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.339802Z","title":"Clone-robust AI alignment","venue":null,"work_id":"eb9cab30-9d66-4c7b-9b71-90f0d9f3b579","year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.870515Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:9c87f821434343e1376667c71a468a09a077ff72f59208b8551fbf253bf1fd62","observation_id":"affd01f2-7976-46e7-b9b2-8b12efb51183","resolution":{"observed_at":"2026-08-15T20:48:03.344695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.325275Z","title":"Fine-tuning language models to find agreement among humans with diverse preferences","venue":null,"work_id":"7ea2d5c6-115a-4b6a-aa99-f8da9161b5f5","year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.875008Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:4ba6b6256c1d503d1dff514a51fc0bf8cfdeeb16ef8779a893901665fb47956f","observation_id":"e95f78dc-4ad8-4b15-ba12-ff7ecfc780b4","resolution":{"observed_at":"2026-08-15T20:48:03.330247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.309928Z","title":"Generative social choice","venue":null,"work_id":"09b6d689-4240-43f3-9870-5fa6ea18ab70","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.879425Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7753ecd4cf3667058a7deafd7c7a8d9a3c2ba71a34d733bf3cc33dc084a996f5","observation_id":"8d68ede3-4ed2-489e-99ac-ef9682074c62","resolution":{"observed_at":"2026-08-15T20:48:03.314894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.294744Z","title":"Cambridge University Press, 2016","venue":null,"work_id":"195ae10c-8a7a-478f-ae46-8d05945b5e49","year":2016},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.884407Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:cbf51c0781b8d22d05e2175ccd6d348a38b6c2a299703cde01b25297f2254bd6","observation_id":"efc9fa8e-acb6-4e16-97a0-f4712cbfc0ca","resolution":{"observed_at":"2026-08-15T20:48:03.299791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.278413Z","title":"The MIT Press, 2012","venue":null,"work_id":"d520743c-4ac6-4d0b-ad14-b0052ec1567f","year":2012},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.889050Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:77eb2ce266194179d19784c389d5d801163aa2288cb6ea3e14e9d09006e81251","observation_id":"253a9dc8-2cd6-4250-89ac-a830d7207e8e","resolution":{"observed_at":"2026-08-15T20:48:03.283693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.262266Z","title":"Friedman.The Elements of Statistical Learning: Data Mining, Inference, and Prediction","venue":null,"work_id":"cffe39cd-547a-4494-8d33-e3b64d985102","year":2009},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.893532Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d3462cb5b3411011c41b109b6582e8563215d67ec7a4d9b2afa16372e4daac03","observation_id":"ec96dc32-8717-49ca-af32-fc5850bab84c","resolution":{"observed_at":"2026-08-15T20:48:03.267712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07629","last_updated":"2023-10-11T16:18:13Z","snapshot_observed_at":"2026-08-16T14:53:00.323975Z","submitted_at":"2023-10-11T16:18:13Z","title":"The Past, Present and Better Future of Feedback Learning in Large Language Models for Subjective Human Preferences and Values","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07629","snapshot_observed_at":"2026-08-15T20:48:01.897987Z","title":"The past, present and better future of feedback learning in large language models for subjective human preferences and values","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.897987Z"},"links":{"cited_paper":"/paper/2310.07629","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b2c4e5cdc33ac679bca6b0d579767d5d205a065e60e5c5d0c1a8b3fec4f6cb36","observation_id":"fd56e2fd-a61f-438f-ba76-c7cc5bb8fbbc","resolution":{"observed_at":"2026-08-15T20:48:01.897987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.246734Z","title":"Zhang, Xinyi Chen, Qiuyi Zhang, Rajesh Ranganath, and Kyunghyun Cho","venue":null,"work_id":"61997e8e-4de4-4f43-9d3c-4aab4769e8a2","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.902944Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:87a399948083d3eb80f4292918e3cbbe3f075279224456626de182fa749cc4f7","observation_id":"227dcb78-9b0b-4339-a040-acbd71f33b58","resolution":{"observed_at":"2026-08-15T20:48:03.251842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03145","last_updated":"2025-06-28T08:52:35Z","snapshot_observed_at":"2026-08-16T13:12:43.059162Z","submitted_at":"2024-10-04T04:56:11Z","title":"Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback","version":2},"cited_work":{"arxiv_id":"2410.03145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03145","snapshot_observed_at":"2026-08-15T20:48:02.349326Z","title":"Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback","venue":"cs.CL","work_id":"cbab9692-740f-480f-b57b-fe2fc109d927","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.907418Z"},"links":{"cited_paper":"/paper/2410.03145","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:cb6f8062dfddcce58bf51d9edcf1012b1166b44026b9a99be875cc21f2c82e71","observation_id":"5c7c0e2d-2551-49a5-865e-9f608fd4fdad","resolution":{"observed_at":"2026-08-15T20:48:02.354507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13595","last_updated":"2023-11-28T18:16:11Z","snapshot_observed_at":"2026-08-16T14:50:20.702051Z","submitted_at":"2023-10-20T15:45:16Z","title":"The History and Risks of Reinforcement Learning and Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13595","snapshot_observed_at":"2026-08-15T20:48:01.912071Z","title":"The history and risks of reinforcement learning and human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.912071Z"},"links":{"cited_paper":"/paper/2310.13595","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:cc62e5ec69bc5a8907520319744b6d544ec62e8e89928a59ef1620e741637abd","observation_id":"1280f3ce-1fdc-400d-b91c-575810737842","resolution":{"observed_at":"2026-08-15T20:48:01.912071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.229956Z","title":"Online, 2024","venue":null,"work_id":"865df2ca-4dc0-4eb5-9cac-b700a8f4bb02","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.916808Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:4570706beb27a51daf629a811f0020c25669fd253727dbf6c092d53a899e5035","observation_id":"0d49b89c-d001-4ec0-9d58-7f6cb594d343","resolution":{"observed_at":"2026-08-15T20:48:03.235927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05699","last_updated":"2021-10-12T02:35:45Z","snapshot_observed_at":"2026-08-16T17:50:07.060819Z","submitted_at":"2021-10-12T02:35:45Z","title":"On Releasing Annotator-Level Labels and Information in Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05699","snapshot_observed_at":"2026-08-15T20:48:01.921683Z","title":"On releasing annotator- level labels and information in datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.921683Z"},"links":{"cited_paper":"/paper/2110.05699","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:0ddff2499d97e34b21d4a8a22393c42afd7db4329765d649deb21857dd6e029f","observation_id":"fa6e8956-26d6-4f30-8159-29adfa2adbac","resolution":{"observed_at":"2026-08-15T20:48:01.921683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-13T10:17:00.791443Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-15T20:48:01.926116Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.926116Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8b66af53ceb9d4c1a660c0fad2e4d1a02b183b2ceae15d7c1d2d6b8e1b2b78de","observation_id":"b5077209-3c03-4eb2-bb8c-524b12307462","resolution":{"observed_at":"2026-08-15T20:48:01.926116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.212970Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"a6a4205b-bc47-4f1d-8895-25097b69576e","year":2020},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.930838Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:ea44f0d1696df5d0ef4176eb3f53e9f50be3959b930195be9d6a3fc4fe834383","observation_id":"89f27be0-ed2b-4887-ae0f-e240261f9f85","resolution":{"observed_at":"2026-08-15T20:48:03.218381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:48:01.935483Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.935483Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7dbd944657a1c3a875cd34c436ed6e8b4fa56ac223b387d9c5855357f13e7641","observation_id":"2d899908-36cb-4678-90c9-69fdc6380333","resolution":{"observed_at":"2026-08-15T20:48:01.935483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T20:48:01.940245Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.940245Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d22f5403a8c05397eb699bc55537021be3adb0f97181d4a11239c42e7fe3dc81","observation_id":"09229ffe-71b9-4f64-aee0-fd9c39e28639","resolution":{"observed_at":"2026-08-15T20:48:01.940245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.196859Z","title":"When does label smoothing help? InProceedings of the 32th Annual Conference on Neural Information Processing Systems (NeurIPS), 2019","venue":null,"work_id":"31f5b279-b4ed-4237-99fb-60ac67bb61f3","year":2019},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.945188Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:42c262960173713fc312e42f3d8e86ebe0e38e2a73e221e8f60c8328e09b29f3","observation_id":"935f7d17-e601-4d86-abb9-3b473bba900a","resolution":{"observed_at":"2026-08-15T20:48:03.202026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-15T20:48:01.949682Z","title":"Secrets of RLHF in large language models part ii: Reward modeling.arXiv preprint arXiv:2401.06080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.949682Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:a724d4c049c0c3e6c4e57bb4d143b2df45b6e24d31696b4138612b44e611ae71","observation_id":"0b0cd5c5-7278-4c5a-a7b3-0ea7ca8dfc02","resolution":{"observed_at":"2026-08-15T20:48:01.949682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22891","last_updated":"2024-10-30T10:39:34Z","snapshot_observed_at":"2026-08-16T13:04:36.557998Z","submitted_at":"2024-10-30T10:39:34Z","title":"VPO: Leveraging the Number of Votes in Preference Optimization","version":1},"cited_work":{"arxiv_id":"2410.22891","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22891","snapshot_observed_at":"2026-08-15T20:48:02.240401Z","title":"VPO: Leveraging the Number of Votes in Preference Optimization","venue":"cs.LG","work_id":"b394dbb4-c453-4267-9b32-6bbf80a2a2af","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.954352Z"},"links":{"cited_paper":"/paper/2410.22891","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:058214e80604ab39af0ec573de32a843d458e1fa37f08b39194a09540531ea3b","observation_id":"f4290753-758c-4db0-b810-38f60de5c556","resolution":{"observed_at":"2026-08-15T20:48:02.247236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.180850Z","title":"Geometric-averaged preference optimization for soft preference labels","venue":null,"work_id":"af751b42-e2f0-43f3-a3eb-3d1c88db9eec","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.959396Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:dc932d3ad39b831aeaf4ac880e6491632b862524987a7eaf590a7ce29daf2316","observation_id":"7e1630d4-f7ad-49d5-bdd7-30ffd41f5755","resolution":{"observed_at":"2026-08-15T20:48:03.186002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19133","last_updated":"2025-05-30T23:40:44Z","snapshot_observed_at":"2026-08-16T13:06:08.255114Z","submitted_at":"2024-10-24T20:04:15Z","title":"Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19133","snapshot_observed_at":"2026-08-15T20:48:01.963857Z","title":"Hybrid preferences: Learning to route instances for human vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.963857Z"},"links":{"cited_paper":"/paper/2410.19133","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:de76ba1487e3ff6a409a6fd5bd92a932a6c9b4779d11f805e264a8eafdbc50f9","observation_id":"9489babc-f28a-4ba8-9f63-5fdaf4df6797","resolution":{"observed_at":"2026-08-15T20:48:01.963857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20296","last_updated":"2025-02-24T16:00:16Z","snapshot_observed_at":"2026-08-16T13:14:07.978719Z","submitted_at":"2024-09-30T13:55:42Z","title":"PersonalLLM: Tailoring LLMs to Individual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20296","snapshot_observed_at":"2026-08-15T20:48:01.968836Z","title":"PersonalLLM: Tailoring LLMs to individual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.968836Z"},"links":{"cited_paper":"/paper/2409.20296","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:305179d09c798ca32dbd7d135fa18f1c9722f1613ebc40b1833043bae32b656f","observation_id":"ae0386f0-5bc1-4fcc-981f-322624dadc21","resolution":{"observed_at":"2026-08-15T20:48:01.968836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T20:48:01.973467Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.973467Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:2461879c82ef675a6d11001ccb860058618dc139508509bfc8df0185c3a5a1f2","observation_id":"977e5d76-02ea-4199-9eea-5075d5515872","resolution":{"observed_at":"2026-08-15T20:48:01.973467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.165093Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"95f72a0a-a0c4-4502-afe7-e9ea280b1a22","year":2020},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.978162Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f4c82e34ce702a33d8345233b910260d1b8fcde97df87fbeab61178e023e160b","observation_id":"6b831d82-e439-4a7f-a594-3ffc7e19ef5e","resolution":{"observed_at":"2026-08-15T20:48:03.170230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.150469Z","title":"Llama 3 model card","venue":null,"work_id":"3d525916-a37c-4d79-8109-7896d6d18bce","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.982655Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7a6c49279849571971ae8e4f09186c1f9d18bb8f0fe62643daf092831694ef0a","observation_id":"1a43929c-4b10-478c-9bb4-17050343fb79","resolution":{"observed_at":"2026-08-15T20:48:03.155048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-15T20:48:01.987206Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.987206Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b24b96afdaafeff85409a862487d2979be288923d05319e2f49d28645fe8e834","observation_id":"7d242f85-8224-4cb8-b5b5-69003d1fa0bb","resolution":{"observed_at":"2026-08-15T20:48:01.987206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-16T13:46:57.986850Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-15T20:48:01.991898Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.991898Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8d365257c000fff77834e51cfbe60086cf8464dacb6deb42527915ed18c30721","observation_id":"125a6178-0df6-44a6-8aba-c00ee0216d30","resolution":{"observed_at":"2026-08-15T20:48:01.991898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.996627Z","title":"A new measure of rank correlation.Biometrika, 30(1-2):81–93, 1938","venue":null,"work_id":null,"year":1938},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.996627Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:59e3280e08f34f666dcfbb5c7f0b36026c06186a10fe15db841172612e1298ed","observation_id":"e4bb9d17-40af-40bb-a3d9-8b1a3eb06701","resolution":{"observed_at":"2026-08-15T20:48:01.996627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.125767Z","title":"Evaluating and inducing personality in pre-trained language models","venue":null,"work_id":"8fdecad6-d1f6-4e4d-a865-a41451542038","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.001044Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1be0e93707d4334e1409d619dc07a5e31dbe3f29a045ec98bcd7dee110725380","observation_id":"0bb58212-792b-4008-9560-0ac9960e6996","resolution":{"observed_at":"2026-08-15T20:48:03.130677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00860","last_updated":"2024-10-30T16:37:50Z","snapshot_observed_at":"2026-08-16T13:04:28.106703Z","submitted_at":"2024-10-30T16:37:50Z","title":"Survey of Cultural Awareness in Language Models: Text and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00860","snapshot_observed_at":"2026-08-15T20:48:02.005763Z","title":"Survey of cultural awareness in language models: Text and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.005763Z"},"links":{"cited_paper":"/paper/2411.00860","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7a9222ca68701b603d323acac2d4b6c6bc3861cba21612aba48eb255cab0d4f3","observation_id":"eab3280e-fed5-450a-a9fd-8f7d7dc2f91d","resolution":{"observed_at":"2026-08-15T20:48:02.005763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08688","last_updated":"2025-04-08T21:11:19Z","snapshot_observed_at":"2026-08-16T12:51:00.482735Z","submitted_at":"2025-03-11T17:59:53Z","title":"Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08688","snapshot_observed_at":"2026-08-15T20:48:02.010384Z","title":"Randomness, not representation: The unreliability of evaluating cultural alignment in LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.010384Z"},"links":{"cited_paper":"/paper/2503.08688","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b366e776da62620bed9851b0ba97b6a5235850848018a9cbf2c03cc6b8c7b314","observation_id":"42924a0b-aa6d-49a7-87f2-6afe057c1754","resolution":{"observed_at":"2026-08-15T20:48:02.010384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-15T20:48:02.015013Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.015013Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:a2cf883caf2a22482cce9d89e10dda926981d88329f02cf3ab5afff472e2d92f","observation_id":"219c5de3-053a-42a4-8c06-6472c7dd5526","resolution":{"observed_at":"2026-08-15T20:48:02.015013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.109623Z","title":"¨Uber den variabilit ¨atsbereich der fourier’schen konstanten von positiven harmonischen funktionen.Rendiconti Del Circolo Matematico di Palermo (1884- 1940), 32(1):193–217, 1911","venue":null,"work_id":"c801ca7a-81d5-4497-a34e-b2db19dd3b2c","year":1940},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.020032Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:15e8e2aaf1c5e82e80613f95eb8c8b3c18e1f05d33ae2b443680d3b3485a3db4","observation_id":"1bca116a-dbfc-47a5-be7d-3a1b2742e3bd","resolution":{"observed_at":"2026-08-15T20:48:03.114625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.095057Z","title":"On the computational complexity of combinatorial problems.Networks, 5(1): 45–68, 1975","venue":null,"work_id":"efce5630-7c86-4fd4-bb7a-b81d0fe79378","year":1975},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.024464Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:538696f863ae33903c04191a1484ad5913bcbab5f01f7e05c01563ba7616a0ee","observation_id":"d4454f1c-08e2-4ab3-9a8c-4e74cd6b6bc0","resolution":{"observed_at":"2026-08-15T20:48:03.099723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.081118Z","title":"Springer, 1988","venue":null,"work_id":"13f850bf-c6df-4629-8683-e182caf02a84","year":1988},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.029040Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:ca82266f7edb6ef4544058a6fc59d60b42a5ef3b07b14c1233610bf83a46c205","observation_id":"61349d3d-2ccb-49a0-acf2-c57b5db02030","resolution":{"observed_at":"2026-08-15T20:48:03.085389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.033787Z","title":"A theorem on the construction of voting paradoxes.Econometrica: Journal of the Econometric Society, pages 608–610, 1953","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.033787Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7827ed2823d840951dbf1c2b949eed1ad6ef06408b674ac1444e29d55350b476","observation_id":"2b126805-a43a-40c7-bfbf-a4e9d037ac9c","resolution":{"observed_at":"2026-08-15T20:48:02.033787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.056569Z","title":"On the density of families of sets.Journal of Combinatorial Theory, Series A, 13(1):145–147, 1972","venue":null,"work_id":"1844e25c-dae9-465b-9e03-065d702da94c","year":1972},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.038325Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:99e5f4880b23f3d7153edd9e22be5a053b84e052d43bfc79e428b60b2a16a7f5","observation_id":"e92c2591-2c5b-452f-a0f1-814ff55e3acb","resolution":{"observed_at":"2026-08-15T20:48:03.061482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.042160Z","title":"Cambridge university press, 2014","venue":null,"work_id":"643566f3-405f-41d5-94c4-cdb79a9a299a","year":2014},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.043005Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:441c6e7496521500fe03705f966d72dc42d32713e00645211e58fa51ae23ad73","observation_id":"24962625-be95-4749-989a-69639c7ae85e","resolution":{"observed_at":"2026-08-15T20:48:03.047246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.027750Z","title":"Soap: Improving and stabilizing Shampoo using Adam","venue":null,"work_id":"29b06148-821c-46a7-87d1-a6d8795dec18","year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.047685Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:46b3139ea0c27afefb7a3ce5e4c61498b222dd2ad1d1df6c7f6c6ce3a0a35491","observation_id":"5dea04a9-bb1e-4647-a07c-a150c74e8629","resolution":{"observed_at":"2026-08-15T20:48:03.032510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.012696Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"f47cb195-b23b-4b17-83ab-cffbe5168b80","year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.052292Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:ef10a92bc7e3f764fa326d2e8bb4cd97b7c49a5d89a2feba28b8af20dde7b7c1","observation_id":"e2144797-bb48-4d96-9e3c-7fe1258269d2","resolution":{"observed_at":"2026-08-15T20:48:03.017495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.997801Z","title":"Iterative data smoothing: Mitigating reward overfitting and overoptimization in RLHF","venue":null,"work_id":"aa71054e-592c-4692-903c-6a087f013f6a","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.056750Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:21d2a098f8de4dd129794aacdf4f81cfec2cf852fda94037468156ffcdfaf1b4","observation_id":"98fe6b40-1563-4a90-aae7-40c68b68f360","resolution":{"observed_at":"2026-08-15T20:48:03.002969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.982511Z","title":"echo chambers,","venue":null,"work_id":"ce71f4b9-6412-4d62-b081-84907919179d","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.061114Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7f753977736a15aafc4ffb1dbd9cc5b5baaf2f8fbe3a39ea4bd05e83b5f20ad2","observation_id":"b4386d4c-eca6-4938-8944-e103e636dfe9","resolution":{"observed_at":"2026-08-15T20:48:02.987514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.965937Z","title":"We index xθ by pairsij withi<j , wherexθ ij =1[r θ(yi)≥r θ(yj)]","venue":null,"work_id":"34678024-f928-4b2a-b92e-2074331fae72","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.065935Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b22f1162cc5ac94103ea28dbc22e461b672e96c55bc68bcef22d9dea269995fb","observation_id":"0ee4aab4-3054-40a1-a8ac-84908bf2e539","resolution":{"observed_at":"2026-08-15T20:48:02.971244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.950718Z","title":"disagreement score","venue":null,"work_id":"2bd24f27-d2f8-4f08-a7e1-4460306c141b","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.070985Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:be0bce53c23b27ea2ce3249f3ff63071183ca1c0d8c9c7db45d1b178b5ffc974","observation_id":"5477df53-3d9c-4e1d-82a5-2a8f015b7584","resolution":{"observed_at":"2026-08-15T20:48:02.955553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.936027Z","title":"Fix m points (z1,t 1),...,(z m,tm)","venue":null,"work_id":"9da9bc8e-b3d9-4daf-be7f-d71ee440d26c","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.076559Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:99018f5518302e9bbeac185e1fe059f611dced914f00deb97a0f61049e680801","observation_id":"44581390-4dd0-4177-8235-d6a148669929","resolution":{"observed_at":"2026-08-15T20:48:02.940766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.918700Z","title":"IfF 2 pseudo-shatters ((z1,y 1),t 1),...,((z m,ym),tm), thenF 1 pseudo-shatters (z1,t 1−y 1),...,(z m,tm−ym), implying that the pseudo-dimension ofF 2 is at most that ofF 1","venue":null,"work_id":"8af1eb9f-b207-4ab1-8280-0502387f8e9b","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.081480Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6d0c9f6f7e2fdab10e532699f020a08724dd8ae9603524ff626d26f5ce3dd790","observation_id":"a9c24194-7c3e-4518-8801-a976b1ac980b","resolution":{"observed_at":"2026-08-15T20:48:02.924732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.903276Z","title":"overall” preference. In our experiments, we specifically use the “overall","venue":null,"work_id":"fbe6b4d1-7404-487c-a733-be5f9ab631a1","year":2008},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.087057Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f77f232f2098e8276cb0fbd0180350dbb88e9695cefa8058eb0680b041891680","observation_id":"61edd47a-c44e-42a5-aed8-c9fe362532b1","resolution":{"observed_at":"2026-08-15T20:48:02.908571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2506.06298."}