{"as_of":"2026-08-08T13:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:739a91db3a89d837e9efefa933196b2d582f695785706101112d4399420f2ce9","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:49:12.618400Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:50:33.210790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:16:28.587559Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23749","snapshot_observed_at":"2026-08-07T22:50:33.210790Z","title":"Distortion of ai alignment: Does preference optimization optimize for preferences? arXiv preprint arXiv:2505.23749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09053","last_updated":"2025-08-05T02:23:31Z","snapshot_observed_at":"2026-08-08T10:12:47.586452Z","submitted_at":"2025-02-13T08:08:27Z","title":"Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers","version":2},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-07T22:50:33.210790Z"},"links":{"cited_paper":"/paper/2505.23749","citing_paper":"/paper/2502.09053"},"observation_digest":"sha256:6da4290e65556d426d34061a5093c83920b237bb4b349abd500c734ff5d684d8","observation_id":"0c2bb61c-f6a6-4a06-8322-dafc461ed06d","resolution":{"observed_at":"2026-08-07T22:50:33.210790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23749","snapshot_observed_at":"2026-08-02T21:09:50.286275Z","title":"Distortion of ai alignment: Does preference optimization optimize for preferences? arXiv preprint arXiv:2505.23749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21556","last_updated":"2026-07-08T07:53:59Z","snapshot_observed_at":"2026-08-07T05:37:34.357048Z","submitted_at":"2026-02-25T04:23:50Z","title":"Power and Limitations of Aggregation in Compound AI Systems","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T21:09:50.286275Z"},"links":{"cited_paper":"/paper/2505.23749","citing_paper":"/paper/2602.21556"},"observation_digest":"sha256:e04f70a059fe38e5ebfb88de45b8a1f0e5d28f8120e7997ad1d58a2d75d8058a","observation_id":"551547b7-8d69-4119-a622-2bb0160cf755","resolution":{"observed_at":"2026-08-02T21:09:50.286275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"cited_work":{"arxiv_id":"2505.23749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distortion of ai alignment: Does preference optimization optimize for preferences?","venue":null,"work_id":"9340bc1d-223b-4c77-a3a7-3c741ee85505","year":2025},"citing_paper":{"arxiv_id":"2604.27733","last_updated":"2026-04-30T11:24:04Z","snapshot_observed_at":"2026-07-06T23:13:11.623453Z","submitted_at":"2026-04-30T11:24:04Z","title":"Mind the Gap: Structure-Aware Consistency in Preference Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-07T06:41:18.311986Z"},"links":{"cited_paper":"/paper/2505.23749","citing_paper":"/paper/2604.27733"},"observation_digest":"sha256:f19812f38afc3feb11b6384aa71f30d4b6cbf69e2e5091a26d191e6b8c76eaa0","observation_id":"f45ffd9c-70ac-4c7b-857c-6846556304ef","resolution":{"observed_at":"2026-05-12T10:16:28.589799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23749","snapshot_observed_at":"2026-07-12T07:49:57.204875Z","title":"arXiv preprint arXiv:2505.23749 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02672","last_updated":"2026-07-17T16:36:37Z","snapshot_observed_at":"2026-08-03T12:51:35.947898Z","submitted_at":"2026-07-02T18:08:50Z","title":"Internal Pluralism and the Limits of Pairwise Comparisons","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-07-12T07:49:57.204875Z"},"links":{"cited_paper":"/paper/2505.23749","citing_paper":"/paper/2607.02672"},"observation_digest":"sha256:61bcc659f1c07290db1665a9e631809613005adf352a40da3785dca37bbbf35e","observation_id":"1da2f02c-27f8-440b-8fa5-c2ad82146aba","resolution":{"observed_at":"2026-07-12T07:49:57.204875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23749","snapshot_observed_at":"2026-08-02T09:03:15.212226Z","title":"arXiv preprint arXiv:2505.23749 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02672","last_updated":"2026-07-17T16:36:37Z","snapshot_observed_at":"2026-08-03T12:51:35.947898Z","submitted_at":"2026-07-02T18:08:50Z","title":"Internal Pluralism and the Limits of Pairwise Comparisons","version":2},"reference_index":222,"source":"arxiv_source","source_observed_at":"2026-08-02T09:03:15.212226Z"},"links":{"cited_paper":"/paper/2505.23749","citing_paper":"/paper/2607.02672"},"observation_digest":"sha256:da11f3fea8ddcc1efae21369b43c3416ddddaca8aa94fea0bb3f723e119187d4","observation_id":"0da2bd54-9479-4abd-a04d-c364a1e6eb54","resolution":{"observed_at":"2026-08-02T09:03:15.212226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23749/citation-record","integrity":"/paper/2505.23749/integrity","json":"/paper/2505.23749/citation-record.json","paper":"/paper/2505.23749"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:21.584903Z","title":"URL https://incidentdatabase.ai/","venue":null,"work_id":"19023e3f-afae-4fca-9498-6f92428bafe5","year":null},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.050224Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:1ca3dbfe0988e7f51c5d8982a44fa3f0a4b48a578718e904410703e0c55297f0","observation_id":"7deaf369-0115-498f-9e6f-35896dbed747","resolution":{"observed_at":"2026-08-07T12:49:21.735414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:04.218743Z","title":"Statistical methods for ranking data, volume 1341","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.218743Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:5623116c4de99b22d4a85ac7fca7d377b1fee998a6221bd74579f407e51bb613","observation_id":"f17035f9-7e11-455c-a298-7639db870ecf","resolution":{"observed_at":"2026-08-07T12:49:04.218743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:21.334455Z","title":"Approximating optimal social choice under metric preferences","venue":null,"work_id":"e19e2aaa-0b73-491d-925a-cf162cbfa232","year":2018},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.359091Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:a28077db99ed57db9997946b6a490ec9dd694ff0c82896ae715db74780ba725a","observation_id":"f044d052-40b6-424c-b74d-4b9bf0b44fd6","resolution":{"observed_at":"2026-08-07T12:49:21.448648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:21.096583Z","title":"Voudouris","venue":null,"work_id":"f33f9426-8be9-4164-87d9-b8a2540377a1","year":2021},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.481803Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:102e3a7d325124490d9a9beaa9026bdc552ca50cb8c7da6bd261a6c16110c921","observation_id":"39a3ad23-7acb-4a70-aaec-668482b00c9e","resolution":{"observed_at":"2026-08-07T12:49:21.210185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.977254Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"2a2bd476-c50b-4cd3-b2d4-ce1c43ad0293","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.663339Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:79ea7f759c832f7404c961834e80fc7dfecb04db7885b07be47048b06ed8c842","observation_id":"281a5242-cd7a-4be5-aa31-39f775883da9","resolution":{"observed_at":"2026-08-07T12:49:21.040602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.896450Z","title":"A statistical decision-theoretic framework for social choice","venue":null,"work_id":"062d855a-b19f-49ad-87f4-a0d670a990dc","year":2014},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.811896Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:58fdc59ee6aa02b524417b08f09a0561c184511a685b024eff0ae0046c40d182","observation_id":"933601e4-587f-4584-a255-27fc293941ac","resolution":{"observed_at":"2026-08-07T12:49:20.920213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T12:49:04.928905Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:04.928905Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:ef23f8808a1cc8707ca357d15a38e871467b390b52a8029edf4b141399d6b4e4","observation_id":"6e2ad6e4-b9b9-4bbb-8bfb-0f2cabdaf924","resolution":{"observed_at":"2026-08-07T12:49:04.928905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T12:49:05.079571Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.079571Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:6c93a6d8912a7080f246a0380f05dcf089ddb135876d0cddeec34f01a86bb4a1","observation_id":"124a96fa-0c60-489c-8166-cfaa13d61c76","resolution":{"observed_at":"2026-08-07T12:49:05.079571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.805016Z","title":"Procaccia, and Nisarg Shah","venue":null,"work_id":"85f8c6fa-d392-4c0a-97f5-58aac47f0b1a","year":2021},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.240930Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:e30b51c775acfec7ba4173d2d401d88fb30b63360f30b81604d444a46745f502","observation_id":"4d3a6849-baec-456b-9c58-9dea8b789c5b","resolution":{"observed_at":"2026-08-07T12:49:20.856174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.698123Z","title":"Procaccia, and Or Sheffet","venue":null,"work_id":"2c8bf102-863e-4380-9d87-34034348def5","year":2012},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.355996Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:24900615d2c4914289eec37c77491394206764a386d22272de1c1a3de4bbfeac","observation_id":"a53979b3-731c-4b6b-9285-733542d78c26","resolution":{"observed_at":"2026-08-07T12:49:20.739548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.583822Z","title":"Human alignment of large language models through online preference optimisation","venue":null,"work_id":"1822d178-89ab-40e5-b563-bc9c5fef31fe","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.484886Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:8abbe93d092b621a7bd1fb64859e1ace607574ca7c04dc474a880dc161a3631b","observation_id":"135d9ea8-8faf-4c42-88a4-8e136d720380","resolution":{"observed_at":"2026-08-07T12:49:20.633947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.459032Z","title":"Procaccia","venue":null,"work_id":"85ab87cf-8585-4af5-8b44-a598744bb7c7","year":2011},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.608842Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:5b8ffe2ae80654a517ca78a767913d7b602b8adff2531e7be09cea6d00090b29","observation_id":"74a561e3-88ef-4dfb-a4f0-09abee07dfa2","resolution":{"observed_at":"2026-08-07T12:49:20.517125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T12:49:05.774124Z","title":"Maxmin- RLHF : Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.774124Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:c786249c0dc465db58f37b710f7f9568a550d13f9e965b78f8b717adad708aaf","observation_id":"ceee655c-706a-4bed-9b54-bddb236a2c17","resolution":{"observed_at":"2026-08-07T12:49:05.774124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:20.213242Z","title":"Breaking the Metric Voting Distortion Barrier","venue":null,"work_id":"760731ad-3f0c-47c5-9389-d33ce3cbdc13","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.937891Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:7cce69b95c5b593769fe048bc13c218ad8f884109b8e45820f4a0e7bae2f1975","observation_id":"1505f2ee-acb4-4ea2-b434-c085a5c3cf15","resolution":{"observed_at":"2026-08-07T12:49:20.338470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08469","last_updated":"2024-06-12T17:54:54Z","snapshot_observed_at":"2026-08-07T19:56:45.521787Z","submitted_at":"2024-06-12T17:54:54Z","title":"PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08469","snapshot_observed_at":"2026-08-07T12:49:06.059537Z","title":"Pal: Pluralistic alignment framework for learning from heterogeneous preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.059537Z"},"links":{"cited_paper":"/paper/2406.08469","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:07f200bb6426f4cb90b93327d5af0bc68f3a223edf48eae6b57108f8dfe696c3","observation_id":"657b84e8-a411-47bf-b3d9-913419ba6b05","resolution":{"observed_at":"2026-08-07T12:49:06.059537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:06.193799Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.193799Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:bf4be51f54bc9673df142dc04ff1691fe8cedb2d17ab4849f43929de7650ab6b","observation_id":"b656a40b-4940-4c9c-9452-a3602d222e2b","resolution":{"observed_at":"2026-08-07T12:49:06.193799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:06.339837Z","title":"Direct preference optimization with unobserved preference heterogeneity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.339837Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:1c6c584e0214edc4eb5460f9811a9f77de10e07033e1895b3868c16fcc635b8c","observation_id":"bba5fc7f-0794-4c31-95f9-2e38d7b9a17d","resolution":{"observed_at":"2026-08-07T12:49:06.339837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:06.486162Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.486162Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:241e5a22e3295b732fba34491f17eb336a9f0c4a01aacc554afeaf2e3de3b0c3","observation_id":"f3287c2d-66b1-4ba7-8719-2bad0b0111cd","resolution":{"observed_at":"2026-08-07T12:49:06.486162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:19.954911Z","title":"Common voting rules as maximum likelihood estimators","venue":null,"work_id":"49903cde-d4a1-41d6-b5d4-0a531aa92290","year":2005},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.622030Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:e8e4948acc14ee59600d64243a3cf9059d25197e7b36495c5912cd61a620335d","observation_id":"3f635759-00d9-4f10-a602-8e4f40f0544c","resolution":{"observed_at":"2026-08-07T12:49:20.085504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:19.748184Z","title":"Position: social choice should guide ai alignment in dealing with diverse human feedback","venue":null,"work_id":"fcd3d4a7-e742-4ffd-b644-81b45cca23fe","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.755545Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:fb7fbd72f35f1f09983cc5a8cbdf9746c7d0eb2be0b6c27a68084b585f3896bb","observation_id":"53035af2-5446-4811-8be4-e76807208457","resolution":{"observed_at":"2026-08-07T12:49:19.828790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:19.537245Z","title":"Mapping social choice theory to RLHF","venue":null,"work_id":"a6127ac1-92be-43b2-9598-974cc5765d3f","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:06.899719Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:701749c1b3576e7ebbd941e31d2f19216cdfdb1e982ec2f05ccd8fa9e4a45c5f","observation_id":"8255786f-6863-4923-b588-b353e24419ae","resolution":{"observed_at":"2026-08-07T12:49:19.625540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:19.275569Z","title":"Metric distortion with elicited pairwise comparisons","venue":null,"work_id":"c5990703-0cc1-4820-a724-33c8ebda5f34","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.049863Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:33912615c2df7790551200b6401fb839c44c7b756fc7a6db296eb2646f331698","observation_id":"f930d716-8fae-4698-a4a6-979d1ee73a3c","resolution":{"observed_at":"2026-08-07T12:49:19.389157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:18.995763Z","title":"Optimized Distortion and Proportional Fairness in Voting","venue":null,"work_id":"b481ccc9-b31a-4029-bde1-bfedeb78f2c8","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.201291Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:1ce9716daadf0f6257ade09d58a0a456fb3115e96f2e881e5726e09bf8df5c28","observation_id":"f241ac89-4777-4b40-9923-727fd10053f3","resolution":{"observed_at":"2026-08-07T12:49:19.136531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T12:49:07.327822Z","title":"KTO : Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.327822Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:8a61a426e8907653ee86eb3231fe75c418de3525a799e76994f4dd5e2afeac90","observation_id":"ed957c40-ce0e-4abd-8715-ee0b64d970e2","resolution":{"observed_at":"2026-08-07T12:49:07.327822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:18.773710Z","title":"Fishburn","venue":null,"work_id":"9221bf68-0168-4b20-a68f-58075e29e7c9","year":1984},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.517409Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:9dbff19a0b4a831466ef4a7742fca9eecc73f074e8a54d9c7981e3d273709574","observation_id":"c4d7ac5d-9d6d-4b59-b981-cf5524b77920","resolution":{"observed_at":"2026-08-07T12:49:18.855523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:18.469153Z","title":"Distortion Under Public-Spirited Voting","venue":null,"work_id":"7184bd97-ee19-42ee-8b10-f31c5aca1b9c","year":2023},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.658976Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:815ae338450047d4633e032d7775a8e4b4630f488838bae0e122219c14fcaab1","observation_id":"31fb267e-8df1-492f-8210-f97849efe89a","resolution":{"observed_at":"2026-08-07T12:49:18.619592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14758","last_updated":"2024-11-07T15:40:25Z","snapshot_observed_at":"2026-07-06T18:18:47.640933Z","submitted_at":"2024-05-23T16:29:29Z","title":"Axioms for AI Alignment from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14758","snapshot_observed_at":"2026-08-07T12:49:07.791066Z","title":"Axioms for AI alignment from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.791066Z"},"links":{"cited_paper":"/paper/2405.14758","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:0c6d7cf4506df4cc2075e7d2e7b851bb8b0624ff3e44a961164953f2fccdba43","observation_id":"4c3300b7-4f7e-47ce-81db-41a4f3551c64","resolution":{"observed_at":"2026-08-07T12:49:07.791066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:18.179150Z","title":"Resolving the optimal metric distortion conjecture","venue":null,"work_id":"196f1e7d-aa1c-40f4-8428-534056ba8ee4","year":2020},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:07.927462Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:d4408d13afc01a01ac3bd89efd0a570acd5126547f227714605bf05458ab898a","observation_id":"443802cf-84bc-46c4-a923-a1cc58f2e459","resolution":{"observed_at":"2026-08-07T12:49:18.318623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14223","last_updated":"2026-06-23T22:56:31Z","snapshot_observed_at":"2026-08-06T15:23:03.361635Z","submitted_at":"2024-05-23T06:46:26Z","title":"Metric distortion Under Probabilistic Voting","version":5},"cited_work":{"arxiv_id":"2405.14223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14223","snapshot_observed_at":"2026-08-07T12:49:13.445260Z","title":"Metric distortion Under Probabilistic Voting","venue":"cs.GT","work_id":"9f7f28ad-3c3c-458c-ad49-de4335dc1f3f","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.065470Z"},"links":{"cited_paper":"/paper/2405.14223","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:5b660760b7c2caceba6795c7a1cf01ea97aed252f86a098ec92765fc317cfe8c","observation_id":"d98f4e0b-79c1-45e8-af3a-b78a486267f6","resolution":{"observed_at":"2026-08-07T12:49:13.559350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T12:49:08.217635Z","title":"Correcting the mythos of KL -regularization: Direct alignment without overoptimization via chi-squared preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.217635Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:6f1d0aa978f40ecc0a27dd4c5e3fe472b9a707ea2480d7573a78be5be8d91130","observation_id":"b55ea79f-9f8e-422d-bb49-586c347b5e54","resolution":{"observed_at":"2026-08-07T12:49:08.217635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:17.856648Z","title":"Plurality Veto : A Simple Voting Rule Achieving Optimal Metric Distortion","venue":null,"work_id":"3f22cd98-1a20-4f7a-8e83-c618a5cb8ba7","year":2022},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.372790Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:92a8f185458765d690f9022ba517491059c38fea0a652f7d62d1bb1f24b3b0a8","observation_id":"187a5caa-f303-427a-ab77-a8f27d4a248c","resolution":{"observed_at":"2026-08-07T12:49:17.996032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:17.521963Z","title":"Provably mitigating overoptimization in RLHF : Your SFT loss is implicitly an adversarial regularizer","venue":null,"work_id":"a2f2271d-92c9-4784-9449-1bc7923abf28","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.506337Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:69f27be39e16195f7bef7cfc483478eb273ca2e87dd1fea1a69b55c622563457","observation_id":"af056ee5-f7c8-4972-b936-4e9d118cbfdf","resolution":{"observed_at":"2026-08-07T12:49:17.708990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19266","last_updated":"2025-01-31T16:26:28Z","snapshot_observed_at":"2026-07-06T20:29:07.258163Z","submitted_at":"2025-01-31T16:26:28Z","title":"Jackpot! Alignment as a Maximal Lottery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19266","snapshot_observed_at":"2026-08-07T12:49:08.695717Z","title":"Jackpot! alignment as a maximal lottery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.695717Z"},"links":{"cited_paper":"/paper/2501.19266","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:808577147dc2d3836c335044a05a802540d33032810f204acbf988ad75e15994","observation_id":"34e55da6-758a-4f5d-8540-f8d6d76bcb01","resolution":{"observed_at":"2026-08-07T12:49:08.695717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:17.241993Z","title":"SimPO : Simple preference optimization with a reference-free reward","venue":null,"work_id":"d68b02f6-c78f-45be-bb56-4a07015d191b","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.835075Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:cb7107ffe3385ed703421a8ed1a8e765888a41e3519de223e78158024d755331","observation_id":"380fc395-09fe-4f14-86a5-85e5e85f348c","resolution":{"observed_at":"2026-08-07T12:49:17.358461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16048","last_updated":"2023-10-24T17:59:04Z","snapshot_observed_at":"2026-07-06T16:37:58.121261Z","submitted_at":"2023-10-24T17:59:04Z","title":"AI Alignment and Social Choice: Fundamental Limitations and Policy Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16048","snapshot_observed_at":"2026-08-07T12:49:08.964242Z","title":"Ai alignment and social choice: Fundamental limitations and policy implications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.964242Z"},"links":{"cited_paper":"/paper/2310.16048","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:50a6bfd8675333934f0bfc7f19a4b74e46a983c229da9bb477ca642a231da299","observation_id":"eec2a541-f21b-427a-832c-569c9656b9d6","resolution":{"observed_at":"2026-08-07T12:49:08.964242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:16.883765Z","title":"Nash learning from human feedback","venue":null,"work_id":"92b169e0-5bb8-4ee5-9f60-7e32119f69e0","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.099448Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:90ab0ec954cfdd86efb1bdb3a93d13507f0c5624846f44741e3daf0c8093aaff","observation_id":"0cdd7021-dfb3-48b7-beed-bb8e171de671","resolution":{"observed_at":"2026-08-07T12:49:17.072272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:16.587432Z","title":"Axioms for learning from pairwise comparisons","venue":null,"work_id":"78085230-06ef-45a5-99fa-16c636418115","year":2020},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.270503Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:f76e1062c03b9928ec88d84462097b4a604c6672c4fb352682dc6eb649754e21","observation_id":"ec4ebb3b-c40d-4cb6-a5b3-2407794f695d","resolution":{"observed_at":"2026-08-07T12:49:16.748259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:09.400159Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.400159Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:725efbaf39440f6578eec5a827d63239309ff4ddc0217b3efb108f3910d631fd","observation_id":"d3e44c7f-c6df-4086-ba1e-66ccb2066cb7","resolution":{"observed_at":"2026-08-07T12:49:09.400159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-07T08:11:05.128316Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-07T12:49:09.533133Z","title":"RLHF from heterogeneous feedback via personalization and preference aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.533133Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:d7dd385b46668b39cc4152574f65c2bbec0aa88ba834d88ad647a650e973ac83","observation_id":"a3775ccd-ef83-4694-be14-831abd0f9ccf","resolution":{"observed_at":"2026-08-07T12:49:09.533133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:16.315543Z","title":"Personalizing reinforcement learning from human feedback with variational preference learning","venue":null,"work_id":"9523cf89-d78d-4f88-a5df-b4d6c9101771","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.655174Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:def3723503dd1199923cde63341abde53f97efdf57a658473fdac7458044af5d","observation_id":"3dfc14ac-9814-4f7f-aaf3-284253afea04","resolution":{"observed_at":"2026-08-07T12:49:16.459944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:16.087352Z","title":"Procaccia and Jeffrey S","venue":null,"work_id":"43715cd4-74da-4bc3-b076-98bb2a74ee82","year":2006},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.778185Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:710b091f7732a74bb51a45ab110434d2a1bc1d4c2b7c5c608017b79a089e9f59","observation_id":"f0803d3b-e7d3-4d2e-b241-01c425f39311","resolution":{"observed_at":"2026-08-07T12:49:16.197248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09254","last_updated":"2025-01-16T02:43:44Z","snapshot_observed_at":"2026-08-02T05:25:23.213455Z","submitted_at":"2025-01-16T02:43:44Z","title":"Clone-Robust AI Alignment","version":1},"cited_work":{"arxiv_id":"2501.09254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09254","snapshot_observed_at":"2026-08-07T12:49:13.182463Z","title":"Clone-Robust AI Alignment","venue":"cs.LG","work_id":"d3971e7e-16df-47a4-aab9-974abff6806b","year":2025},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:09.960375Z"},"links":{"cited_paper":"/paper/2501.09254","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:d9addef394e23649911866ed98e9305d7e6cb7b303f2392feb6d721ba85db9e6","observation_id":"f9158f3a-d4a9-4615-8655-ff963d98d703","resolution":{"observed_at":"2026-08-07T12:49:13.263112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:10.086522Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.086522Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:dfe6f5f54e0933bdd2ad1acaacd000484ff63cd443736049311a870da7f4e0ac","observation_id":"a9b96989-7746-4bd0-a0a4-71dd9b38c846","resolution":{"observed_at":"2026-08-07T12:49:10.086522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:49:10.234824Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.234824Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:25dace3929549b8e7ba1918ae9b15e2c4c7b149f7ce40ed2bd23526ed823cc45","observation_id":"32346169-d22e-45e7-964e-082a9f96a582","resolution":{"observed_at":"2026-08-07T12:49:10.234824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16320","last_updated":"2025-02-22T18:46:33Z","snapshot_observed_at":"2026-08-07T17:56:07.086206Z","submitted_at":"2025-02-22T18:46:33Z","title":"Direct Alignment with Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16320","snapshot_observed_at":"2026-08-07T12:49:10.365118Z","title":"Direct alignment with heterogeneous preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.365118Z"},"links":{"cited_paper":"/paper/2502.16320","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:6514d71bda9ddbe2e518b8bc961f1c14894ebd1c09cd8cdd429d745160983b56","observation_id":"55c70479-b0f0-423f-9c06-9d3c7fb55913","resolution":{"observed_at":"2026-08-07T12:49:10.365118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08358","last_updated":"2024-04-17T01:58:09Z","snapshot_observed_at":"2026-07-06T17:01:13.998131Z","submitted_at":"2023-12-13T18:51:34Z","title":"Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08358","snapshot_observed_at":"2026-08-07T12:49:10.543390Z","title":"Distributional preference learning: Understanding and accounting for hidden context in RLHF","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.543390Z"},"links":{"cited_paper":"/paper/2312.08358","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:3f45b5fbb816c1cf90667fa65f46cdec2c205f169ebd01f9c95f66fd7f26964a","observation_id":"5d19d2f2-1c7b-4921-a9fd-08f0ea002ba9","resolution":{"observed_at":"2026-08-07T12:49:10.543390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:15.843081Z","title":"Position: a roadmap to pluralistic alignment","venue":null,"work_id":"841b5797-20a1-4cf1-b045-7b0234c58d95","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.662526Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:4ecae268bb5a93ab722072bcf5ceb8eb497c6e0f594a71afb4824dd1ec128ae3","observation_id":"85be41e3-bb23-401c-9146-ccc3194f7a51","resolution":{"observed_at":"2026-08-07T12:49:15.958217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T12:49:10.847272Z","title":"A minimaximalist approach to reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.847272Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:567f4e3f88069ec819be692207907342fd5c7c926df9a5490d81658e3075fe87","observation_id":"cd7f7b4b-28b6-43e8-b9aa-3ae3317ff2c8","resolution":{"observed_at":"2026-08-07T12:49:10.847272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:15.540326Z","title":"Learning populations of preferences via pairwise comparison queries","venue":null,"work_id":"b50fd26f-bac6-4cc3-b2c2-4c45a1ee8939","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.025830Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:0abb8fe8df5fe0485f181737de707ed829c06f6d1507525ad76575807d63efe5","observation_id":"d8c9c893-73b3-4dc6-afdf-e447d80452e0","resolution":{"observed_at":"2026-08-07T12:49:15.702859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:15.237295Z","title":"Is RLHF more difficult than standard RL ? a theoretical perspective","venue":null,"work_id":"11b83b23-6d67-4054-b88b-d5c429097c12","year":2023},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.141013Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:6f4aafce130a8fffb2d9e2a309df15346848e15460bd5ad68448847b9ae852e5","observation_id":"2389c91d-76bf-4b95-a76a-2daf0a194396","resolution":{"observed_at":"2026-08-07T12:49:15.379770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:14.975519Z","title":"Metric learning from limited pairwise preference comparisons","venue":null,"work_id":"b79285be-37c9-4626-9d23-d338aa6dc3f2","year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.304347Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:edb0605c9b64917df329e8178a5d38b5ca9c26fb5156b72c9b501153f39b9c44","observation_id":"73729af5-8349-48e5-b23e-46786efbb058","resolution":{"observed_at":"2026-08-07T12:49:15.107506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T12:49:11.460500Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.460500Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:7e1ce051aa8f62d3e0304b2ffa3dd015f86c833ec669523d1cad1f7bc7e9fcfc","observation_id":"f4cbf904-d1a0-4470-bc7c-2ff692979b15","resolution":{"observed_at":"2026-08-07T12:49:11.460500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:14.736379Z","title":"Bayesian estimators as voting rules","venue":null,"work_id":"966836b3-cc34-4b95-8d6d-d55d2a7c528d","year":2018},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.576108Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:3dd87a544f71dcc9c8b2765a47498163a126be0213772b0c9f2105fedceb8e65","observation_id":"72cd5d9d-8c3e-4ba5-b8b9-c87ae757715d","resolution":{"observed_at":"2026-08-07T12:49:14.853647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:14.487314Z","title":"Learning and decision-making from rank data","venue":null,"work_id":"a64ea32e-e981-4e63-b67b-d643c0adf968","year":2019},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.774245Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:fc7a2cec108ce9801897104ab9bacd073968d05cf2b7c44a5bf93125963a3e85","observation_id":"95b897aa-fda4-43fc-9d1e-beac3deecb61","resolution":{"observed_at":"2026-08-07T12:49:14.606243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13132","last_updated":"2022-05-24T15:16:22Z","snapshot_observed_at":"2026-08-01T15:54:11.015801Z","submitted_at":"2022-01-31T11:23:31Z","title":"On the identifiability of mixtures of ranking models","version":2},"cited_work":{"arxiv_id":"2201.13132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.13132","snapshot_observed_at":"2026-08-07T12:49:12.843105Z","title":"On the identifiability of mixtures of ranking models","venue":"cs.LG","work_id":"4192916e-70dd-4673-9b0c-3e07d95da57f","year":2022},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:11.935144Z"},"links":{"cited_paper":"/paper/2201.13132","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:54e9393d388483b8c13ade9ff3883e5808543e6f71070d669f16aed9d0e1aab2","observation_id":"4bdc156b-1a8c-44a1-927b-62721605be01","resolution":{"observed_at":"2026-08-07T12:49:12.965798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:14.161847Z","title":"Learning mixtures of plackett-luce models from structured partial orders","venue":null,"work_id":"8ec35f2b-f7c2-42f1-a2fe-ad4902c50ddb","year":2019},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:12.133491Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:e33902e44d8d29799a7b26ca0c4d29c0ed4f0b8423c3485e3cc603c5d0011682","observation_id":"2295f788-56e7-4694-a0bc-4acd973fa490","resolution":{"observed_at":"2026-08-07T12:49:14.337018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:49:13.893010Z","title":"Learning mixtures of plackett-luce models","venue":null,"work_id":"4793cefb-f10e-4af5-9d47-5bb0d31741cb","year":2016},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:12.283875Z"},"links":{"citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:e9539f072c24617bcf77eaf08289c1ed8aa1829b2e60f64209f39d89b1968e4f","observation_id":"a108ef03-f17e-45ac-a714-4404501048aa","resolution":{"observed_at":"2026-08-07T12:49:14.038561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05006","last_updated":"2024-03-08T03:05:11Z","snapshot_observed_at":"2026-07-06T17:41:23.460300Z","submitted_at":"2024-03-08T03:05:11Z","title":"Provable Multi-Party Reinforcement Learning with Diverse Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05006","snapshot_observed_at":"2026-08-07T12:49:12.458231Z","title":"Provable multi-party reinforcement learning with diverse human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:12.458231Z"},"links":{"cited_paper":"/paper/2403.05006","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:b556a4447e993fc1c37c1274e95e18f12a9bb237fc8ee7e9e965e9f98493a1a3","observation_id":"86890663-deca-4538-9ae6-381b1a419079","resolution":{"observed_at":"2026-08-07T12:49:12.458231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T12:49:12.618400Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:12.618400Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:9286bebf9a93c21ba4b9ddbd283b0d72a1d8e0e604086d6bf31f9d8aa2f7d86e","observation_id":"23373edc-8627-46d1-a076-7e35ca23979c","resolution":{"observed_at":"2026-08-07T12:49:12.618400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":33},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 5 inbound Pith citation observations for arXiv:2505.23749."}