{"as_of":"2026-08-08T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a96667ae663555914c6ffef076cf79fa3c809b79a1284d17c12e58c1cd543ed","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:32:21.331060Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.10505/citation-record","integrity":"/paper/2502.10505/integrity","json":"/paper/2502.10505/citation-record.json","paper":"/paper/2502.10505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:23.022939Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":"9734ad25-bcde-4936-b522-d33c183827b4","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.903864Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:53a6e1d5a2846e96a10801df2f3e71b27737213f299aad0dd3340381dd578814","observation_id":"d6180138-a454-4301-9e33-643e150b0bb8","resolution":{"observed_at":"2026-08-07T18:32:23.028818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.999345Z","title":"Calibration and consistency of adversarial surrogate losses","venue":null,"work_id":"4eec21be-b4eb-4ab2-a74a-a8f5d8355777","year":2021},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.910320Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:dc86e09c2016b60124e4ac7bc94e67ece56d7cd3da4972ba3e5964c604c7b47b","observation_id":"1b074722-1adc-408b-b4cb-9b3f3040dc52","resolution":{"observed_at":"2026-08-07T18:32:23.007001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.977502Z","title":"Multi-class h -consistency bounds","venue":null,"work_id":"029f3f57-af18-45f0-b1b6-e5b16ef1acfc","year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.916903Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:f34a57c48b3829d75c89c8db40ceaf36e485a1da84dc8e8756a27c37e808cb8e","observation_id":"4c251466-16c3-4b63-b3ac-5d2ad985737c","resolution":{"observed_at":"2026-08-07T18:32:22.983272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.959995Z","title":"G., Rowland, M., Piot, B., Guo, D., Calandriello, D., Valko, M., and Munos, R","venue":null,"work_id":"231f9361-7900-4e59-891f-7f65abb4e900","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.924819Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:c619faeb435e081e9824dabcfcc04c26296b9059d1f2d649fcccd5680dcfa63a","observation_id":"4c2cc416-e36f-4b17-94ca-93af7a38517c","resolution":{"observed_at":"2026-08-07T18:32:22.965345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.932090Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":"f9ad7eb6-2cf5-4e96-928f-f746dfb4433c","year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.932361Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:5bcc2a17e823f3e9da1be152a3eed2b356b574953ae73986e7ba661d994925e2","observation_id":"d8ab9d49-91d5-49cd-a64c-2dc628851e04","resolution":{"observed_at":"2026-08-07T18:32:22.938806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-08-07T23:49:29.478548Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01373","snapshot_observed_at":"2026-08-07T18:32:20.938380Z","title":"G., Bradley, H., O'Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.938380Z"},"links":{"cited_paper":"/paper/2304.01373","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:58d538ef4dce5d3f3848322914d3216d44c5c4e9c2919b10604034e6eea3419f","observation_id":"bad98efd-8a4b-48f9-9230-63a8f1eee886","resolution":{"observed_at":"2026-08-07T18:32:20.938380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00950","last_updated":"2021-12-02T03:08:23Z","snapshot_observed_at":"2026-07-06T12:14:24.842188Z","submitted_at":"2021-12-02T03:08:23Z","title":"Quantile Filtered Imitation Learning","version":1},"cited_work":{"arxiv_id":"2112.00950","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00950","snapshot_observed_at":"2026-08-07T18:32:22.002044Z","title":"Quantile Filtered Imitation Learning","venue":"cs.LG","work_id":"da01327a-a083-4d3e-9825-f9adbe895090","year":2021},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.946064Z"},"links":{"cited_paper":"/paper/2112.00950","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:ae48c5e885a64ae9ae9cfb8cbc72b83572125ea370b6e1b67b41d9dd68d2079f","observation_id":"5e77688e-f12f-4247-b719-10fae9e6a0b8","resolution":{"observed_at":"2026-08-07T18:32:22.012736Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.913497Z","title":"Probabilistic interpretation of feedforward classification network outputs, with relationships to statistical pattern recognition","venue":null,"work_id":"7619e609-c95c-4ca2-9e69-8c109332061b","year":1990},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.952817Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:f8a3d0e07c672bf26193df4f9dd92a1b54779583595959dd0812e28ea95f7f73","observation_id":"43afe68a-4ec2-412e-85dc-3230471c94a9","resolution":{"observed_at":"2026-08-07T18:32:22.919649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08635","last_updated":"2024-03-13T15:47:26Z","snapshot_observed_at":"2026-07-06T17:44:00.848335Z","submitted_at":"2024-03-13T15:47:26Z","title":"Human Alignment of Large Language Models through Online Preference Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08635","snapshot_observed_at":"2026-08-07T18:32:20.963680Z","title":"A., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.963680Z"},"links":{"cited_paper":"/paper/2403.08635","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:ad7ef22dca8128dc3f2b2994a59c2054038a32aa4932cf1a4d54ee0046e78555","observation_id":"9f07e96b-2159-4740-a1d1-875239dda663","resolution":{"observed_at":"2026-08-07T18:32:20.963680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.892593Z","title":"H., Chen, X., Zhang, Q., Ranganath, R., and Cho, K","venue":null,"work_id":"df87769b-baec-41b7-a6f1-297ea61d8e6c","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.971802Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:6f88b46d500551c8cf919ff913caf53f08d8131a4e84632e03555b30809597af","observation_id":"8107c9da-f2c5-40f5-8b2f-330139a41e75","resolution":{"observed_at":"2026-08-07T18:32:22.898525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-07T18:32:20.983164Z","title":"F., Leike, J., Brown, T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.983164Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:cbcb36480596747e0c78f8b1d94dd4c58aac9362741d2e7a5715b89ad07034d1","observation_id":"2902befc-3e72-43b6-acfe-88eb4cef412d","resolution":{"observed_at":"2026-08-07T18:32:20.983164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.858526Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"19068236-5210-42a8-bbaf-4f2cba981d1e","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.989748Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:91afd6bb7625eea025c8b985f7179fd9fbcdceebc1a8f98a68048ca45ff1aaa7","observation_id":"b619d067-3659-4495-ad93-2921e730fb13","resolution":{"observed_at":"2026-08-07T18:32:22.864549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.832857Z","title":"Understanding dataset difficulty with v-usable information","venue":null,"work_id":"1e04853e-f13e-4440-a557-479603186019","year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.001625Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:ccd4bf0c4b69f080a5d0df092a4674a745359578ac9f3c9124168f5c1ffe71d0","observation_id":"51dd05ae-79b1-41fc-ba02-c0308782ba0f","resolution":{"observed_at":"2026-08-07T18:32:22.839675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.807683Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":"b5d8edbe-17df-4fac-a821-8d79b38f33e4","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.008913Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:77e2c2c8bbf279f37e3681754836150af47320c871d44855cdf4b65959596935","observation_id":"c5d841ae-b317-4623-9930-c2b9d97c89b4","resolution":{"observed_at":"2026-08-07T18:32:22.814056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.782877Z","title":"L., Srinivasan, S., Konyushkova, K., Weerts, L., Sharma, A., Siddhant, A., Ahern, A., Wang, M., Gu, C., Macherey, W., Doucet, A., Firat, O., and de Freitas, N","venue":null,"work_id":"5f72c4e1-f0b7-43c3-a9dd-854ce1a7d332","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.015499Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:5bf8e60beaac2cbc5babf21595e673876695db25a6f295d2e40fd25f835a35c0","observation_id":"b64d9244-8006-498c-96d9-4831e68de4b7","resolution":{"observed_at":"2026-08-07T18:32:22.788839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T18:32:21.022389Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.022389Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:f950d45ca21b76f2f398230e1951caa8e6ef124f0e6de254a1f9e15540357a6c","observation_id":"5724ed26-706e-4021-a240-b524f4676b17","resolution":{"observed_at":"2026-08-07T18:32:21.022389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21662","last_updated":"2025-02-16T20:19:36Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:11:45Z","title":"$f$-PO: Generalizing Preference Optimization with $f$-divergence Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21662","snapshot_observed_at":"2026-08-07T18:32:21.028109Z","title":"f -po: Generalizing preference optimization with f -divergence minimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.028109Z"},"links":{"cited_paper":"/paper/2410.21662","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:0843bd32d5779aa08ac93458167533aa4f18a58b61d9892487c180671ef4ab5a","observation_id":"40ae999b-8da0-42a5-b001-6d340fead544","resolution":{"observed_at":"2026-08-07T18:32:21.028109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T18:32:21.033460Z","title":"D., Sun, W., Krishnamurthy, A., and Foster, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.033460Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:72a467042999069da9c1f138352e359f6e6062f50d5fb42c85730891bc551956","observation_id":"e3f076e6-6916-4baf-95d1-94ee9fcb0d54","resolution":{"observed_at":"2026-08-07T18:32:21.033460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.755403Z","title":"A., Choi, Y., and Hajishirzi, H","venue":null,"work_id":"cb25b2a0-69a3-4ac2-a235-c583ab3420ef","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.038358Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:988d1befe140f969ed74db700a1e40ba7dda1608def93d4da7a8f5a341e111cd","observation_id":"52740ac5-432c-4efb-870d-81ff9b8c7ff2","resolution":{"observed_at":"2026-08-07T18:32:22.766300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-07-06T17:23:55.166594Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-07T18:32:21.045898Z","title":"Towards efficient and exact optimization of language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.045898Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:7e4c4269e49a78b847c43f7726de69165923d6af19a4f32085a1c0a9b2d94a73","observation_id":"42270018-9ef5-4abf-b241-7186c0528296","resolution":{"observed_at":"2026-08-07T18:32:21.045898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-03T11:31:07.805515Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-07T18:32:21.053077Z","title":"A survey on human preference learning for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.053077Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:194d1b01ecc63839aed86b6d188d1e6708427301b5928d235c2456ad6c3cab64","observation_id":"eb3b3895-c27c-4a72-9c09-74f8b2d8a384","resolution":{"observed_at":"2026-08-07T18:32:21.053077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:21.059995Z","title":"A survey of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.059995Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:9f9e87fff033eacf956a597e8ebebceb0963d884928fba0c7c2963cdfd795624","observation_id":"f6ba482e-7eed-4cf0-ba69-08f0200da95b","resolution":{"observed_at":"2026-08-07T18:32:21.059995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.724224Z","title":"Understanding the effects of rlhf on llm generalisation and diversity","venue":null,"work_id":"7ad0b7ea-51a8-4c0e-aa03-b747ed105473","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.066417Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:7c02dfd724729899dce1d7a224a29e066d37b84299f006f79efc1edb313a18bc","observation_id":"15754356-b360-4f9e-948e-14bdfb38a397","resolution":{"observed_at":"2026-08-07T18:32:22.729922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-06T15:18:02.072435Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-07T18:32:21.072721Z","title":"R., Stevens, K., Barhoum, A., Duc, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.072721Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:b24de483c688d88bd14c16d859d93706e2b5b4b01523063259a0f303740fe7c4","observation_id":"d73ad913-60ec-4daa-947a-c504d2031a5d","resolution":{"observed_at":"2026-08-07T18:32:21.072721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.701483Z","title":"Huggingface h4 stack exchange preference dataset","venue":null,"work_id":"5f420265-9b01-4393-9a44-647ba44c5132","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.080097Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:40f40c0980443b8bb394cebc58d878519fa5f3757cb3327e583dd1e46345c3be","observation_id":"103738c8-633e-451f-be24-7474252aa77b","resolution":{"observed_at":"2026-08-07T18:32:22.710240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06259","last_updated":"2024-03-12T05:22:46Z","snapshot_observed_at":"2026-07-06T16:05:23.421896Z","submitted_at":"2023-08-11T17:47:54Z","title":"Self-Alignment with Instruction Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06259","snapshot_observed_at":"2026-08-07T18:32:21.086641Z","title":"Self-alignment with instruction backtranslation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.086641Z"},"links":{"cited_paper":"/paper/2308.06259","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:8b4a060adff06da882ee1901e3b4d3c06e7428a55a16e11c87db5e62703a98ad","observation_id":"367c276c-8757-48fc-ba82-3f127d3ae281","resolution":{"observed_at":"2026-08-07T18:32:21.086641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.679976Z","title":null,"venue":null,"work_id":"94a17ed1-0f62-4e02-b8aa-d8e537a0c4a1","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.093625Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:e4ba9866db6d40a229f30a6351e0ab69510d078144ba7e108077c0e8f31e0115","observation_id":"959bff62-81b5-428d-a8df-db9dabe0082d","resolution":{"observed_at":"2026-08-07T18:32:22.686595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-07T18:32:21.100629Z","title":"A., Socher, R., Amatriain, X., and Gao, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.100629Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1ccafd43cdbc06a3cade68b0a1b5579842a3fdce2d0971dfcb606b12505d607c","observation_id":"14b5bd41-343a-4f2a-b5ca-7ae15d2060c1","resolution":{"observed_at":"2026-08-07T18:32:21.100629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.657793Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"d64172c8-c093-418e-af6b-efb00d47524e","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.113252Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:a922700bd5f0338edf5cca47895e0fb10b1f28c99fce4ace532af9bc64bd48b0","observation_id":"74293d31-b9a8-4b0c-98c0-135fa23159a2","resolution":{"observed_at":"2026-08-07T18:32:22.663308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.636151Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"598fc43c-5129-4612-b006-7e52b9924990","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.119438Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:8225bf45fdfddd4ad2e7c252e0a25e8bddea0ed02929e948126fdbd66a1b47b5","observation_id":"39550b1e-bb78-4ec1-85ed-2813f2bada54","resolution":{"observed_at":"2026-08-07T18:32:22.641721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.613381Z","title":"G., Rowland, M., Guo, Z","venue":null,"work_id":"14d7c271-4de4-4a36-9009-eac15ee80087","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.125490Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:42bcc99bf8da213344a318f12d40c81c261268d37532dcd22f4a3fd65e00ee95","observation_id":"465c40fd-57e9-44af-9f9e-309cf5c2cfec","resolution":{"observed_at":"2026-08-07T18:32:22.621373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.595612Z","title":"A., Lindsten, F., and Blei, D","venue":null,"work_id":"3870879c-99f7-4c7f-9383-c60edc380f05","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.131839Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:38af59ed3096f165eb186a0c8099e8233175f45496142cae501c9bf08db5b96c","observation_id":"20c613a0-c772-4fd1-86f1-899de5cc54a6","resolution":{"observed_at":"2026-08-07T18:32:22.601091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.569766Z","title":"Gpt-4 technical report","venue":null,"work_id":"512d1a26-c32e-4880-bdc0-be3ee3c67ef4","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.139010Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1bb63cfd4ef68ad7533e48940ee93c29ab5a44300e31dbb930db1f4b1704628d","observation_id":"5336bf60-2085-4690-9267-135c1e51011f","resolution":{"observed_at":"2026-08-07T18:32:22.582335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T18:32:21.145340Z","title":"L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.145340Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:e01853338dadd9992fe82c7146d0b89ec0ecc063bbf1ab608652118811b6edc7","observation_id":"816e2397-35a3-4c92-9c0f-9672f797b1e2","resolution":{"observed_at":"2026-08-07T18:32:21.145340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-07-31T05:05:41.080329Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T18:32:21.154929Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.154929Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:37111e0e22be39b811211e50576c0e6aa396e9fdd8612e02bdbb363020f07b8d","observation_id":"fd5fa80e-fc39-44b0-87a1-6a881f593f98","resolution":{"observed_at":"2026-08-07T18:32:21.154929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T18:32:21.165463Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.165463Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:16817298fe416f56c4e4b90082cc45c46e239f38034a9b561db0d4d0c62e2fed","observation_id":"85b9a4a5-97aa-499d-8585-18d3b2556cd4","resolution":{"observed_at":"2026-08-07T18:32:21.165463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.543628Z","title":"From r to q^* : Your language model is secretly a q-function","venue":null,"work_id":"d3275bc6-4198-4355-b902-25c24eef4b4c","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.171588Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:2024e789037d8cdb83263eed05cc5f4482a9ebde649a46e74375fd30df6057bb","observation_id":"f5b4a645-6411-48d5-a1b2-a2dc0a364c3c","resolution":{"observed_at":"2026-08-07T18:32:22.549800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.522323Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"2e6d7885-4aa5-4e2c-b003-f9d2ecca78ac","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.177265Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1bdffdb9160ff2b7b111117f9928e605e91b3fd654e3142272c339e8c817b5af","observation_id":"1b439a24-3a82-4014-9314-a15db84d1e18","resolution":{"observed_at":"2026-08-07T18:32:22.528340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.497435Z","title":"Black box variational inference","venue":null,"work_id":"446dddbe-7663-46cc-8b52-000975d0e3d5","year":2014},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.183300Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:8ab5d623dd1c4cac96863b3d5776e0aacd5cd36ccab5469c2077a00b26d68dba","observation_id":"05e21823-4197-4c1b-8316-77d5cd106f45","resolution":{"observed_at":"2026-08-07T18:32:22.507183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-07T18:32:21.189249Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.189249Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:9fc2d69084536e27ad7041f50751d37cd88c35abb5e079cb64e57184db2c19cc","observation_id":"2b6830b4-152f-418b-afd5-34dffd1e055f","resolution":{"observed_at":"2026-08-07T18:32:21.189249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.470106Z","title":"Vanishing gradients in reinforcement finetuning of language models","venue":null,"work_id":"5f9f9826-f933-4764-85f4-889f0b41cbfc","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.195177Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:b565e092ebdbb249c91c77fd3c97a20e5fe7b242613c1f5e3153d63f0ee82dfe","observation_id":"a389f205-5390-4018-9842-8d8291d01b0c","resolution":{"observed_at":"2026-08-07T18:32:22.481360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.443462Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences, 2024","venue":null,"work_id":"89c8b4b3-6e75-4b06-8a13-546d1a41eeb6","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.200061Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:b62167746b333399c1488294e278f3fa968db6afe27615882f0d9566cbd0328a","observation_id":"cacef77f-dca8-49dd-a1ec-72cd0c5e9daf","resolution":{"observed_at":"2026-08-07T18:32:22.452006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16320","last_updated":"2025-02-22T18:46:33Z","snapshot_observed_at":"2026-08-07T17:56:07.086206Z","submitted_at":"2025-02-22T18:46:33Z","title":"Direct Alignment with Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16320","snapshot_observed_at":"2026-08-07T18:32:21.206355Z","title":"Direct alignment with heterogeneous preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.206355Z"},"links":{"cited_paper":"/paper/2502.16320","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:8b1d476d63a381d74faec57b29edde09fd47110f3c6ffd6c0b35f70a46ada8eb","observation_id":"64519d34-4c42-4d2f-a260-b89f02cfed61","resolution":{"observed_at":"2026-08-07T18:32:21.206355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T18:32:21.215175Z","title":"A long way to go: Investigating length correlations in rlhf, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.215175Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:6c32a3bdfa425571b3fa3d49c57c8b07ffecca85173b3a830b8ae1ad3a7311e8","observation_id":"823f03aa-ab4a-4e29-9d59-69a72139f1aa","resolution":{"observed_at":"2026-08-07T18:32:21.215175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.414753Z","title":"Distributional preference learning: Understanding and accounting for hidden context in rlhf","venue":null,"work_id":"9f32a312-26ba-48a4-9875-c99b00ba34ce","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.221926Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:c1b8a1ca804f9b361db6c34138249adcc8e9406061548f2f88bade0e2c3e2719","observation_id":"fea3bb9f-372c-4b55-89ef-4ac8e716d64b","resolution":{"observed_at":"2026-08-07T18:32:22.424473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00365-006-0668-8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:21.387398Z","title":"How to compare different loss functions and their risks","venue":null,"work_id":"dfc42435-0812-447d-ac9e-8935c6382521","year":2007},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.227381Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:59e136caebf33a85eeffe4b2b0b8c7bfdcb59b7232e0283d7dbcd73838fdcfb3","observation_id":"d577a9f7-535e-42c8-8c1a-7fde56c8e413","resolution":{"observed_at":"2026-08-07T18:32:21.406280Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T18:32:21.232480Z","title":"M., Lowe, R","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.232480Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:5937ae5b4912fb483309d9b4ed5154bb31608025595aa5d676ca1b87a20c3a5c","observation_id":"3b65fc6e-bc9e-44f5-a051-1c4c21f62af3","resolution":{"observed_at":"2026-08-07T18:32:21.232480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.389140Z","title":"S., and Agarwal, A","venue":null,"work_id":"15f08a3f-7841-4cb9-9ba2-857bdc9ed3cf","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.237661Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:e9e95b9b758687fe5faab41f9ca9ad4a04d09250cf2cdd89cce14d169d0d8342","observation_id":"a9667a6d-961a-4104-b483-ad8b2d1fbb5f","resolution":{"observed_at":"2026-08-07T18:32:22.394366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.369145Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data","venue":null,"work_id":"dd734c3d-9b37-43bb-9f57-d4d43f5494c8","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.243309Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:93059a4bc28dbe2c3d52a7ebcb98a43931ca40f17e0ff148f5a3977c6c716e5a","observation_id":"59644008-f9e1-4566-9f7d-bb638ceb40cd","resolution":{"observed_at":"2026-08-07T18:32:22.375130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.341546Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"94ba1886-2624-4ec0-aaa5-4bfe04fddcf9","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.250115Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:e70d7197c07eb7cfb7e608b6343e191ab5fd8fcde1df75439f5348fe9d456c58","observation_id":"a8b1c143-4b83-49ea-bf47-4462a0fc4edb","resolution":{"observed_at":"2026-08-07T18:32:22.348188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.315916Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":"750ae84a-7fff-49c6-b197-601ca6cf3829","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.259111Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:22f32c00aa761fa8de70a38430cbe03637be0a07241f5b0e52151365c373b12d","observation_id":"8a4e59a3-d701-4d99-98be-dd44878199ec","resolution":{"observed_at":"2026-08-07T18:32:22.322709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.287503Z","title":"Enabling language models to implicitly learn self-improvement","venue":null,"work_id":"f1b89169-b221-4056-b1bb-261c2434b5fb","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.265704Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1b2ecf46ab542e26369107e7a04c1c6d5cf201f11297ae2827e6f9c721f67acf","observation_id":"14b72f64-ca56-407f-aee4-3b0792b5404b","resolution":{"observed_at":"2026-08-07T18:32:22.297854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.256381Z","title":"Transforming and combining rewards for aligning large language models","venue":null,"work_id":"0ec3f090-c066-42ce-abfb-d9abd97246ca","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.273577Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1e012c2f0bb0bcf8b78c7a561f80103d3f6729c6200e099d2e2620b9c66b4711","observation_id":"622b1c22-0d0e-4116-9b0c-ca6b54aefe74","resolution":{"observed_at":"2026-08-07T18:32:22.261958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.229294Z","title":"Policy gradient algorithms","venue":null,"work_id":"b58e5180-1e74-493b-83df-2fa24140ce78","year":2018},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.282655Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:704440d5f26ec96d899c742717a9dd53adeb214065c5c52e7eca23e35fa3a428","observation_id":"14cf1242-2bb1-4135-80d9-aa4b0aefe821","resolution":{"observed_at":"2026-08-07T18:32:22.238493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.190273Z","title":"V., Murray, K., and Kim, Y","venue":null,"work_id":"7c70d608-cad1-4d38-af7c-3e6a07ac401d","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.289186Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:c802f95dab2998e71ce58d7e58f6f5f030ca542898a1dc2fc044d603bc2c2cb3","observation_id":"74368c74-59ad-45f1-a388-e08c26b885b0","resolution":{"observed_at":"2026-08-07T18:32:22.201317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T18:32:21.300233Z","title":"Some things are more cringe than others: Iterative preference optimization with the pairwise cringe loss, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.300233Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:d5ee4b40a83521492e771fac633ce487892e68bc2864e8423bba5e5cbeba426f","observation_id":"97ad70a4-9085-4d57-ad7e-f3d6738836c3","resolution":{"observed_at":"2026-08-07T18:32:21.300233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.168109Z","title":"Y., Cho, K., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":"90504695-47e9-40a1-82fe-0cbb6fff0a10","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.307867Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:186c311bc97df048cbc8da713063fcd723e1326881973664f24632a8f4935437","observation_id":"00f98043-ba0a-4e26-a390-a345ade3e382","resolution":{"observed_at":"2026-08-07T18:32:22.175500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.136437Z","title":null,"venue":null,"work_id":"554f42ab-a71e-4066-a027-cd6aaf7fddd6","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.312919Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:282e7c1343738155c7466ca9c0b7910a075545c7f70c6acdc2e07bee691e3c3d","observation_id":"5e8863dd-e6f4-4a5c-8ebe-e6fde31070dd","resolution":{"observed_at":"2026-08-07T18:32:22.143704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.114099Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"b63f88c1-3588-4a58-816a-06deb0ea6371","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.318779Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:9216f82b2e4607ad3f0de35deea894c1c9dff1ac7a6a8520f67d1325d4200e5f","observation_id":"862eb67f-a726-4035-9669-b97892d90489","resolution":{"observed_at":"2026-08-07T18:32:22.120972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.090198Z","title":"I., and Jiao, J","venue":null,"work_id":"e8ea01dc-6cef-4c21-8afa-ac51dc04fb78","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.325381Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:eaa729a897ed16067551cccc519e62ce2a66381c57322a0f538b29d5e94e2e41","observation_id":"e9610168-ebbd-4b38-b0c3-8b7fab8f24bc","resolution":{"observed_at":"2026-08-07T18:32:22.100251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:21.331060Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.331060Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:bd6b01ed665df98d9b691a0609194b04cb1dff614b9420c3e3cbc3b8ffa760d3","observation_id":"4419939a-a0f5-49a7-b640-ecc4d607b2e2","resolution":{"observed_at":"2026-08-07T18:32:21.331060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2502.10505."}