{"as_of":"2026-08-08T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5aeb43c0f83a352450e536ab1e55dbf9d424d1fccbbcf281f520e4b89f1c2010","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T13:09:54.433720Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T14:26:06.428076Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T14:28:21.295190Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"cited_work":{"arxiv_id":"2509.23102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23102","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiplayer Nash Preference Optimization","venue":"cs.AI","work_id":"d48ed6e9-5427-4ef4-9d83-d59ca4ee8ff4","year":2025},"citing_paper":{"arxiv_id":"2605.04494","last_updated":"2026-05-06T04:50:42Z","snapshot_observed_at":"2026-07-31T05:58:54.504742Z","submitted_at":"2026-05-06T04:50:42Z","title":"Towards General Preference Alignment: Diffusion Models at Nash Equilibrium","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T16:54:58.732444Z"},"links":{"cited_paper":"/paper/2509.23102","citing_paper":"/paper/2605.04494"},"observation_digest":"sha256:3f845655ed1ee87d3104fe0cf4b8fe9c6f3e6081cb24a27d0e3d41bfd8222537","observation_id":"069db180-de2f-4c4e-a638-63ad38bbb031","resolution":{"observed_at":"2026-05-11T17:56:06.889210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"cited_work":{"arxiv_id":"2509.23102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23102","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiplayer Nash Preference Optimization","venue":"cs.AI","work_id":"d48ed6e9-5427-4ef4-9d83-d59ca4ee8ff4","year":2025},"citing_paper":{"arxiv_id":"2605.17342","last_updated":"2026-05-17T09:27:26Z","snapshot_observed_at":"2026-08-02T08:43:29.718077Z","submitted_at":"2026-05-17T09:27:26Z","title":"Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-20T14:26:06.428076Z"},"links":{"cited_paper":"/paper/2509.23102","citing_paper":"/paper/2605.17342"},"observation_digest":"sha256:a3309672bbef55ab2d51177e59d4c38c6c52cc2ac1f5a7ff31471d6aa376b5a2","observation_id":"c1091f69-54be-48f8-bfb9-9b2a54ebea9a","resolution":{"observed_at":"2026-05-20T14:28:21.296641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.23102/citation-record","integrity":"/paper/2509.23102/integrity","json":"/paper/2509.23102/citation-record.json","paper":"/paper/2509.23102"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:e3899c113c755e9c2037421aaad5287817843eade938d06b23353af293bb8374","observation_id":"990ce93d-a989-401a-888f-8910532dc3fb","resolution":{"observed_at":"2026-05-18T13:11:24.010757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08635","last_updated":"2024-03-13T15:47:26Z","snapshot_observed_at":"2026-07-06T17:44:00.848335Z","submitted_at":"2024-03-13T15:47:26Z","title":"Human Alignment of Large Language Models through Online Preference Optimisation","version":1},"cited_work":{"arxiv_id":"2403.08635","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08635","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human alignment of large language models through online preference optimisation.arXiv preprint arXiv:2403.08635","venue":null,"work_id":"e8dc1621-327c-4050-9841-64a73db5f2e8","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2403.08635","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:493d61db17f95339b52c716ae48df525d1f38927961a4313384f23d7ac3a4c6b","observation_id":"90faa925-f9ee-4c16-8373-4b82a5ff6928","resolution":{"observed_at":"2026-05-18T13:11:24.031523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:85615a1eb54e449a2f0c84044795d0fa50ba438370c003605c299f6cf6ff670d","observation_id":"87a54057-82c6-411a-95d6-f5c709ca948e","resolution":{"observed_at":"2026-05-18T13:11:23.992454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":"2401.01335","doi":"10.48550/arxiv.2401.01335","metadata_source":"pith","pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","venue":"cs.LG","work_id":"6b7f0773-4e99-4274-9d8e-279a1f25c5e1","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:436ad5dd47c77e3b2aca770302f7a83079e49dd608f3c94829f95708513a8d92","observation_id":"4f265f3d-330e-4ab6-b074-ad16d690f936","resolution":{"observed_at":"2026-05-18T13:11:23.996253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:822b940bafadf944068505a8208bed47d7c49725c8598496391f455939a989ec","observation_id":"a484db74-b16e-4104-8868-e16e157377c1","resolution":{"observed_at":"2026-05-18T13:11:23.969722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":"2310.01377","doi":"10.1007/s10618-021-00759-3","metadata_source":"pith","pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","venue":"cs.CL","work_id":"5f1e5704-a4ce-482a-b124-b3692397be11","year":2023},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:f775b8fc3fc8f3a69678181b005e6b6ae8cce962aaabb653a533f763cc082ae5","observation_id":"599039fa-d35e-4424-951b-8c5c78476c6a","resolution":{"observed_at":"2026-05-18T13:11:24.049816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":"2405.07863","doi":"10.48550/arxiv.2405.07863","metadata_source":"pith","pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","venue":"cs.LG","work_id":"c7ff0d97-6f12-4146-bf55-c37c42517893","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:f811f62efac333cccf7f51de17887257c0562e88f13b72554c5df9b815ae8e61","observation_id":"f28c62cc-cde8-4b72-b882-e0e16d0f2cd3","resolution":{"observed_at":"2026-05-18T13:11:24.060389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":"2404.04475","doi":"10.48550/arxiv.2404.04475","metadata_source":"pith","pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","venue":"cs.LG","work_id":"ef25adcf-addb-445e-b3b5-858eeb9883ca","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:701eb116ee869fac76ea22abd6e91fd5e11fee3c325bb2ef8720733ee2819d58","observation_id":"4b6d2d59-44a1-493b-a62d-710e3aeb177d","resolution":{"observed_at":"2026-05-18T13:11:24.046566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":"2402.01306","doi":"10.48550/arxiv.2402.01306","metadata_source":"pith","pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","venue":"cs.LG","work_id":"28f4db09-e48a-458a-967b-755399c7d663","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:d29747b85cfc9c67ca44dc242e03dd537dfaacd1218a82519ad8cf2e99d38d92","observation_id":"c017d731-c26d-4c09-a187-5bde5969b007","resolution":{"observed_at":"2026-05-18T13:11:24.057089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19316","last_updated":"2025-03-03T08:22:25Z","snapshot_observed_at":"2026-08-02T12:00:09.704648Z","submitted_at":"2024-05-29T17:39:48Z","title":"Robust Preference Optimization through Reward Model Distillation","version":2},"cited_work":{"arxiv_id":"2405.19316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19316","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust preference optimization through reward model distillation.arXiv preprint arXiv:2405.19316","venue":null,"work_id":"58cd9403-b152-4aa6-bfbd-0221d82947a5","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2405.19316","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:ccf3276a9c38455a8369fbc8e69a60febe735c6eaedde433cde7bc8c31e9cba1","observation_id":"76f6a24b-e98e-4788-ac89-2b54f12811da","resolution":{"observed_at":"2026-05-18T13:11:23.953881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:d8ec9f8f2bc3323016229b5bbc6f9781b9b9d6390f75fb47a09077350c1216df","observation_id":"1e4e2ea0-d071-4431-9fb4-0fad811c067d","resolution":{"observed_at":"2026-05-18T13:11:24.018070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:2c969a3f8284e2accb847c79c1251af8ffb770994bb0cf5d34e45263fd89a2cc","observation_id":"8e318a42-e6b4-4224-8dd0-dd1bc80105a0","resolution":{"observed_at":"2026-05-18T13:11:24.035030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":"2403.07691","doi":"10.48550/arxiv.2403.07691","metadata_source":"pith","pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":"cs.CL","work_id":"93ad9e7b-6db2-4249-a0fa-8a96ef124d53","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:260eda5119f4a18ca19af9f1d7a75e40b97e31b526102edf90f8c55eff13c5dc","observation_id":"9f66dc85-7e8a-49d5-8fe7-94bcc5b8e78d","resolution":{"observed_at":"2026-05-18T13:11:24.071919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From live data to high-quality benchmarks: The arena-hard pipeline.Blog post.[Accessed 07-02-2025]","venue":null,"work_id":"6858d9de-b031-4f06-a815-fc11ee913a65","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:e6a32023fa066e8ff5ce83cd82f4e2b41d6850a7d6953b8b2d91d0641d376c7d","observation_id":"a53c05b3-003c-453e-9298-06c4da0769c6","resolution":{"observed_at":"2026-05-18T13:11:25.001298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":"2109.07958","doi":"10.48550/arxiv.2109.07958","metadata_source":"pith","pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","venue":"cs.CL","work_id":"22e3b047-a6e8-4c4c-b62e-173b545a1a45","year":2021},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:a998c54a674b2ff0ffa40a54e1c337643fb39e79c83e2d4a9b9d315fbca60ca6","observation_id":"0315044d-b440-40a0-9fd4-df3c56a3b16a","resolution":{"observed_at":"2026-05-18T13:11:24.091395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:06.068721+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:06.068721+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:f9f9e1c7b7367a5e5fe0e979cc2c4aa61e002a58cc15d9cfaab70066545e0cb5","observation_id":"e8ab4fa3-0eda-43c9-b095-3099760038b8","resolution":{"observed_at":"2026-05-18T13:11:23.987973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.22578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:49:37.325188Z","title":"The hidden link between rlhf and contrastive learning.arXiv preprint arXiv:2506.22578","venue":null,"work_id":"2830c794-3402-48db-8699-dcdf18ab0a3f","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:0f7e681bbe81ff622feabace6f9e2344c39059395021ab5df00d87453b0eaf79","observation_id":"59e7694c-76f2-4396-a14c-70c57178ce24","resolution":{"observed_at":"2026-05-18T13:11:23.949194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:ba82ba772ee9820e8f76449ccdf647ccc443f71794acf75247dca3a998ad9f5d","observation_id":"60b45b80-0383-4fa7-8acb-c871fe844295","resolution":{"observed_at":"2026-05-18T13:11:23.958548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.15843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-dpo: Improving data utilization in direct preference optimization using a guiding reference model.arXiv preprint arXiv:2504.15843","venue":null,"work_id":"8c941ab6-6e23-4f6d-94e6-25830347d91c","year":null},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:3f54e716ff22fd14e4d4957cccf348ba529d108febec5ce39f89a1834d4e9775","observation_id":"1f2724e5-37d9-45c3-8e8f-0be4bf8d592e","resolution":{"observed_at":"2026-05-18T13:11:24.098915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-04T02:06:41.618052Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":"2403.19159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-07-04T19:40:07.153004Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":"5c5cb19d-6bc2-4433-8810-992baaf48d4a","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:65c551fb5d8496cafc1909640637b41432c5ad3a7c8d892eff4fa4504d3347c5","observation_id":"4a85e76b-341b-4052-832a-3d4680e1b659","resolution":{"observed_at":"2026-05-18T13:11:24.001156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:e8cadf9484699004a82ea5c2c13d53b0e339c7c8a51f8e213354d28b4f33de19","observation_id":"4bbf2b40-5962-4839-b7d1-094cdec1c94d","resolution":{"observed_at":"2026-05-18T13:11:23.944650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:7b451baa27419a284c706af0baa5b98310d5981880031f865337ec16fe22baf1","observation_id":"d5cea3a4-c3cd-443b-96d8-cc17c2d6d8c4","resolution":{"observed_at":"2026-05-18T13:11:23.939607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:6702149538aee6ebd9c2a9aab234432a87bb43aa07c95435f998e271ca78a797","observation_id":"40c2dd33-6f91-4f15-9b98-a6e8e4c06910","resolution":{"observed_at":"2026-05-18T13:11:23.962835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05825","last_updated":"2023-04-11T17:50:16Z","snapshot_observed_at":"2026-08-07T18:21:52.532112Z","submitted_at":"2022-06-12T19:49:14Z","title":"A Unified Approach to Reinforcement Learning, Quantal Response Equilibria, and Two-Player Zero-Sum Games","version":4},"cited_work":{"arxiv_id":"2206.05825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.05825","snapshot_observed_at":"2026-07-08T03:24:28.820322Z","title":"A unified approach to reinforcement learning, quantal response equilibria, and two-player zero-sum games","venue":"cs.LG","work_id":"a0a0402a-15aa-4ea0-aabb-44ad059f86cd","year":2022},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2206.05825","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:b96d27ad612c035fed14152bc547cfb3fd8de258b14f764765086b05d7fda76b","observation_id":"2b233b10-28b9-47d9-b0cd-ab49eb3aba8d","resolution":{"observed_at":"2026-05-18T13:11:23.978594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-07-06T20:29:21.568793Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"cited_work":{"arxiv_id":"2502.00203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-aware preference optimization: A unified mathematical framework for model alignment.arXiv preprint arXiv:2502.00203","venue":null,"work_id":"a7be4db7-7430-4f1f-b472-e4e34ef39e59","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2502.00203","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:6278936a247fe8b4d5aa8c5dbf723791dea50260c8494beb57213729f0599761","observation_id":"a01f68e3-aa5b-46ee-b15d-5caafd728814","resolution":{"observed_at":"2026-05-18T13:11:24.076019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:f77b15dc62bced654bcae56d3947900b5f2e362112564362d54199c03020b7e7","observation_id":"5e404c24-35ac-48b4-8b18-4832b6d28ae9","resolution":{"observed_at":"2026-05-18T13:11:24.079371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:4a1107692d1339fab5b67b4a10dee5de7c742b7e6eb69b7625a888d166ea0b35","observation_id":"5128dbfc-81aa-47b3-8f2c-44cc02513757","resolution":{"observed_at":"2026-05-18T13:11:24.083212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06601","last_updated":"2023-03-18T20:44:45Z","snapshot_observed_at":"2026-08-03T12:43:10.574809Z","submitted_at":"2022-04-13T18:41:41Z","title":"Causal Confusion and Reward Misidentification in Preference-Based Reward Learning","version":4},"cited_work":{"arxiv_id":"2204.06601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.06601","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal confusion and reward misidentification in preference-based reward learning","venue":null,"work_id":"6eb02a1c-105c-45d7-87a6-1e5568fcb4b5","year":2022},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2204.06601","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:1df42457fadbc260304e47f7f18b177fe61c61bf1472965699f3930edb8647ef","observation_id":"d30fb4d1-e33d-41f5-81fb-75d86b60e1bd","resolution":{"observed_at":"2026-05-18T13:11:24.068249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:bbbeccc03fa584740f61e5041595a2b9f0f8bf876394ecb29c653bc573b27d7e","observation_id":"16949879-736a-40a2-b1a9-74e0f343206d","resolution":{"observed_at":"2026-05-18T13:11:24.039547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16714","last_updated":"2025-04-19T15:59:33Z","snapshot_observed_at":"2026-08-01T15:17:33.999228Z","submitted_at":"2024-10-22T05:51:34Z","title":"Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment","version":3},"cited_work":{"arxiv_id":"2410.16714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16714","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"00973137-e73b-4eb1-ab3d-f6fee1f99b8d","year":null},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2410.16714","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:d43818d3efb572618a5b579abd9efa77c614e8a59f1b5e3c1af3335a4ede9af1","observation_id":"e630a4a0-faaa-45a8-8123-a41233ba089d","resolution":{"observed_at":"2026-05-18T13:11:24.006252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":"2405.00675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-07-01T15:35:47.595284Z","title":"Jing Xu, Andrew Lee, Sainbayar Sukhbaatar, and Jason Weston","venue":null,"work_id":"9d5b91f5-dd34-4c04-925b-ae80101224d5","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:72e93c32dfb79a735b4bf29e6b60f279641c3ed25846c726888268e8b2097bc1","observation_id":"c069f4b2-bd1d-4910-bd7c-1ac1976f5b5e","resolution":{"observed_at":"2026-05-18T13:11:24.087385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-07-31T03:29:04.443362Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":"2405.21046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-07-04T08:59:42.597221Z","title":"Exploratory preference optimization: Harnessing implicit q*-approximation for sample-efficient rlhf.arXiv preprint arXiv:2405.21046","venue":null,"work_id":"0aa48ef2-655f-4669-b834-b2b71f89a413","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:9c092c12d1118601d763f676fc5a7be92a63fb65add973d20a1b1a851fb26430","observation_id":"cc1d093a-2bae-44c8-a20e-caad02b45eec","resolution":{"observed_at":"2026-05-18T13:11:24.053907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":"2312.11456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-07-03T08:07:45.294768Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint.arXiv preprint arXiv:2312.11456","venue":null,"work_id":"a7265aa9-5ce8-4a96-acfd-3f069003f21d","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:2775e666f5cfda0070f267f1fa35ba8c7c086cce755de9826e39fa282a2fbacb","observation_id":"a187e3c4-ed2a-4fd9-bc9c-25ad2c792f07","resolution":{"observed_at":"2026-05-18T13:11:24.027237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-07-06T17:16:13.055978Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":"2401.08417","doi":"10.48550/arxiv.2401.08417","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2401.08417 , year=","venue":"arXiv (Cornell University)","work_id":"f3bb620d-f01d-48ea-bf4b-c11e79c18ad6","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:c4716d54289e921ab9ee89118f669a2335807030c9a31e5d3e79f85ec8a2abc8","observation_id":"ea2b1167-7325-4b3d-a3e5-78e03367dc93","resolution":{"observed_at":"2026-05-18T13:11:23.983816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:cff005e3cc4e46236f620e8dabc750078dfed4979973d7b02526d09c84f46e86","observation_id":"2519bbae-2272-4422-9df6-d6745d1c3c19","resolution":{"observed_at":"2026-05-18T13:11:24.108463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:87772d93a62509a541ec1c09477c6639486ec51878bbac26ac793f0aa7d749b1","observation_id":"0d2ebbe0-42e6-41b1-a165-1904522704bc","resolution":{"observed_at":"2026-05-18T13:11:24.043054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:ca29e0b91eb3d9e7a9128a6aaf54c1a86a61b193ab8046f5754a8aa411e01855","observation_id":"7b517741-e3b3-42c5-a97d-37e8906b71d3","resolution":{"observed_at":"2026-05-18T13:11:24.064514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:4880bb4b5b9d63112b5ee1dadaeb3a4b90cb20af6198f25aa588c2416754288b","observation_id":"6e24e9a2-3a0e-460d-bb4d-1c0251ef9412","resolution":{"observed_at":"2026-05-18T13:11:24.014337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16852","last_updated":"2025-02-24T05:24:52Z","snapshot_observed_at":"2026-08-07T17:54:16.806953Z","submitted_at":"2025-02-24T05:24:52Z","title":"Improving LLM General Preference Alignment via Optimistic Online Mirror Descent","version":1},"cited_work":{"arxiv_id":"2502.16852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.16852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving LLM general preference alignment via optimistic online mirror descent","venue":null,"work_id":"f683d7e0-430b-4748-a7de-fa775b0811aa","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2502.16852","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:fc9f2e061a9f03bbfd4109740c7407e141aba69681aa35f599eee9348051cb09","observation_id":"d8df3fe8-36b7-4734-82a2-68f7d0244696","resolution":{"observed_at":"2026-05-18T13:11:24.022728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:0b8da894da0a33c1252a262fcd73367471c2a34ffb35082c7570b3586798c2c9","observation_id":"da2b461c-efe9-45b4-95bb-25728d5e8ff4","resolution":{"observed_at":"2026-05-18T13:11:24.094783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08942","last_updated":"2025-07-09T05:35:31Z","snapshot_observed_at":"2026-08-07T17:11:35.450079Z","submitted_at":"2025-03-11T22:44:54Z","title":"Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback","version":3},"cited_work":{"arxiv_id":"2503.08942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08942","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extragradient preference optimization (egpo): Beyond last-iterate convergence for nash learning from human feedback.arXiv preprint arXiv:2503.08942","venue":null,"work_id":"cf8b8574-7c2e-499f-a11d-c55383a59927","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2503.08942","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:df179d750236921c7fb4e40c121888a642231ca6dd321400b3e2d79814594820","observation_id":"95a1eeb1-752b-4012-a402-27bab3384241","resolution":{"observed_at":"2026-05-18T13:11:24.103703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11827","last_updated":"2024-10-03T21:37:02Z","snapshot_observed_at":"2026-08-07T01:07:23.105104Z","submitted_at":"2024-06-17T17:59:13Z","title":"WPO: Enhancing RLHF with Weighted Preference Optimization","version":2},"cited_work":{"arxiv_id":"2406.11827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wpo: Enhancing rlhf with weighted preference optimization","venue":null,"work_id":"a15f3a5a-e839-40dc-a5b7-cda4a21a0302","year":null},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2406.11827","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:2b3b62e7b7c3b4710fa44219bf4b844c66f3f04e83eb3845ffd16b609e06dbca","observation_id":"1c95817d-50dd-43a6-b6c0-f3a4f254a0ed","resolution":{"observed_at":"2026-05-18T13:11:23.974150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-play methods like SPIN (Chen et al., 2024), SPPO (Wu et al., 2024), and INPO (Zhang et al., 2025b) use no- regret dynamics, while Pre-DPO (Pan et al","venue":null,"work_id":"70f19632-728c-4a8f-a388-b9f561d33b7c","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:d93025339bf0e007ca2aee788f5e276a55f44251136ea812e2d16116f0768b9d","observation_id":"3d4d6ceb-0672-4a88-89dc-d9c1badf1550","resolution":{"observed_at":"2026-05-18T13:11:24.993887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More recent methods, such as ONPO (Zhang et al., 2025a) and EGPO (Zhou et al., 2025), introduce optimism and extragradient techniques for stable convergence under noisy preferences","venue":null,"work_id":"fbfd391e-6e03-4a24-b2e7-607e75592633","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:b4e187be61ecadf077ceb04316b159e8d59509597972a69082c0dbfa462c607e","observation_id":"a72b05d9-8af9-4b55-b7a2-d928e8501565","resolution":{"observed_at":"2026-05-18T13:11:24.996355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"INPO (Zhang et al., 2025b) is reproduced according to the settings described in the paper","venue":null,"work_id":"d7e8486b-a8ff-41ad-8c57-f3e5e98cc832","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:283fea676b3a5b0414df5ff097f24208ed23078d299dc9c3b96b3dab488deeb8","observation_id":"0f46fac3-4fcb-466e-bc98-8f3d9eb3a37b","resolution":{"observed_at":"2026-05-18T13:11:24.991274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"minimal","venue":null,"work_id":"07cb4288-34a7-4abe-bcb4-aa5337915e2c","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:9ee3254ef1360fa5951e7c8553889fca3836067e130b52973d38078edc9506a3","observation_id":"8c7501f8-5662-4941-ab8a-a1d0eefd0b6e","resolution":{"observed_at":"2026-05-18T13:11:24.988894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"logπθ y+t π′t y+t −logπθ y−t π′t y−t −η 2 #2 , whereπ′t= argminπ E(x,y+t ,y−t)∼Dt","venue":null,"work_id":"cf5f4e82-3456-4ff3-98c8-96544ac4ea2b","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:317de9f2f5cda6d0f2b17030619716c014d196bec9f1576701e984f9830bd95e","observation_id":"8e66d95a-469f-4e4b-a4b8-32ce090948d0","resolution":{"observed_at":"2026-05-18T13:11:24.986614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4764f800-032f-4fc1-b3c1-e9f39250cb5e","year":1999},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:2d717b9f195635d4e1fa331e7249572b5ca3144fd9e88467f3ad4a6943c67fea","observation_id":"1c4ff70f-d39e-4c71-b097-6b5b5a848949","resolution":{"observed_at":"2026-05-18T13:11:24.998801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":38,"verified_fuzzy":6},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2509.23102."}