{"as_of":"2026-08-06T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f1754a87bb6fa59031d8d00e9982967365b57078ce3e8b57cffdfb2f5741fd2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:08:56.617012Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:06:55.872775Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T12:17:53.478052Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2402.01306"},"observation_digest":"sha256:4da7c9d70581d01913fb3e9076db77e6e5dc483c4588f36ebad9ae65aa8beb41","observation_id":"148b4597-b560-4a14-9dee-189fc89bff1f","resolution":{"observed_at":"2026-05-12T12:17:53.556390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2408.15339","last_updated":"2026-05-07T20:32:48Z","snapshot_observed_at":"2026-08-06T15:22:00.046544Z","submitted_at":"2024-08-27T18:04:07Z","title":"UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T21:22:36.970101Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2408.15339"},"observation_digest":"sha256:52e3ec95e8c4ae9300add0ac0c3330ed51480917537a23f2f96a4f274cabce01","observation_id":"526fd740-085f-4992-a9f9-b3d9e4eebd52","resolution":{"observed_at":"2026-05-23T21:23:27.384210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2502.06387","last_updated":"2026-04-07T06:33:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-10T12:15:27Z","title":"How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-23T03:56:18.703995Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2502.06387"},"observation_digest":"sha256:adf5ac6761619462ea89c1bbf7bad82253db86894e4e703d6fe95dbef9f73993","observation_id":"15b61f5f-8df9-4c0e-8730-d495dde7959e","resolution":{"observed_at":"2026-05-23T03:57:29.556527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2505.19134","last_updated":"2026-04-13T23:58:15Z","snapshot_observed_at":"2026-07-06T21:30:04.828669Z","submitted_at":"2025-05-25T13:11:55Z","title":"Incentivizing High-Quality Human Annotations with Golden Questions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T13:41:26.730528Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2505.19134"},"observation_digest":"sha256:4544aa744ef3d8a0f9e4dc4dbf7a2b173455c186c965fedf12dbe9de04b5af57","observation_id":"30aadae7-2443-4c38-9558-65ab51d5d6dd","resolution":{"observed_at":"2026-05-19T13:42:19.361562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-05T22:08:56.617012Z","title":"Munos, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07466","last_updated":"2025-08-10T19:53:23Z","snapshot_observed_at":"2026-08-06T11:51:19.057174Z","submitted_at":"2025-08-10T19:53:23Z","title":"Grounding Natural Language for Multi-agent Decision-Making with Multi-agentic LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:08:56.617012Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2508.07466"},"observation_digest":"sha256:b5122630841515cf60f63cebd43cf150e3c82ba1813c8c9433a3eebf84b8682b","observation_id":"a3cd3657-fa64-4176-b4ce-dc9a7c65ebfc","resolution":{"observed_at":"2026-08-05T22:08:56.617012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:0956cc37ab718c5dddf44ba63c2a8350bf8c263fd9bf8020a771cc80baea7286","observation_id":"60b45b80-0383-4fa7-8acb-c871fe844295","resolution":{"observed_at":"2026-05-18T13:11:23.958548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-04T10:40:57.669889Z","title":"InProceedings of the 41st International Conference on Machine Learning (ICML) (Proceedings of Machine Learning Research, Vol","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09330","last_updated":"2026-05-31T10:03:39Z","snapshot_observed_at":"2026-08-06T10:10:13.146102Z","submitted_at":"2025-10-10T12:32:43Z","title":"Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:57.669889Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2510.09330"},"observation_digest":"sha256:4d1579d02a87f1747a21362085ad44d3706c71d52e2fc2b8dce465e26bd97ee1","observation_id":"0c981e19-615a-494e-ace3-f7193d967e00","resolution":{"observed_at":"2026-08-04T10:40:57.669889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-03T14:24:23.615297Z","title":"Mankowitz, Doina Precup, and Bilal Piot","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.20806","last_updated":"2026-05-31T13:11:43Z","snapshot_observed_at":"2026-08-06T07:38:24.259000Z","submitted_at":"2025-12-23T22:13:14Z","title":"Safety Alignment of LMs via Non-cooperative Games","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T14:24:23.615297Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2512.20806"},"observation_digest":"sha256:6735d21e9eba1bf6e69bcfc174908e4598d50ab4ff1110c7db838bdf7170a10c","observation_id":"e1af94db-53b0-4dd8-9598-0ae13b266a4f","resolution":{"observed_at":"2026-08-03T14:24:23.615297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:50443c2fc86ea11ac1d844c5ec6ccd68be06114f73a0633e76ba2167e0b405af","observation_id":"53a01c0a-9734-478d-ab79-e241af13b989","resolution":{"observed_at":"2026-05-16T06:37:28.624270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:2588322baae1492396d618cbfe73f866fcea4ab509ac640bc4756e3753005bad","observation_id":"0bde6246-f87d-4b37-868a-439a6fc25875","resolution":{"observed_at":"2026-05-21T13:10:10.465569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2604.04410","last_updated":"2026-04-06T04:21:24Z","snapshot_observed_at":"2026-07-06T22:53:24.585766Z","submitted_at":"2026-04-06T04:21:24Z","title":"Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:43:51.965882Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2604.04410"},"observation_digest":"sha256:67c302000462445d04e775afa3cc0e2c28a755ae8e586bf97061779adece0dbb","observation_id":"9897e36d-a351-40ec-a2b0-45164887c80c","resolution":{"observed_at":"2026-05-10T22:35:49.320786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:b8b5cd9f62ccb487a5dbf85d6d999a8445f5b2d4ec6c62c6c7e49dc86711c4ab","observation_id":"b7285d33-29b8-44e5-908d-fe7e2778d833","resolution":{"observed_at":"2026-05-11T04:45:59.579682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2605.07331","last_updated":"2026-05-08T06:35:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T06:35:02Z","title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T01:19:58.448344Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2605.07331"},"observation_digest":"sha256:922ba8ee8c8e7bb4141b344839cdf6606802d6d9d67542da093ba606bb1ed21f","observation_id":"8342c205-b8dd-4cb3-8264-27178e3552fb","resolution":{"observed_at":"2026-05-11T04:30:55.196686Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2605.09214","last_updated":"2026-05-09T23:17:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T23:17:46Z","title":"Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:14.379908Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2605.09214"},"observation_digest":"sha256:d71541fd70257f1aab5d0e5158285b9cbd6a17b19644fe4d1db15e565c81e675","observation_id":"04463d32-a51b-422d-b73c-6a22e62e7938","resolution":{"observed_at":"2026-05-12T06:56:31.010410Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":"2312.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-02T12:06:55.872775Z","title":"15 UNA: Unifying Alignments of RLHF/PPO, DPO and KTO by a Generalized Implicit Reward Function Nvidia, :, Bo Adler, Niket Agarwal, Ashwath Aithal, Dong H","venue":null,"work_id":"68eab96a-f89c-4142-b7f3-5bc5b90c42ea","year":2023},"citing_paper":{"arxiv_id":"2606.06053","last_updated":"2026-07-12T09:46:20Z","snapshot_observed_at":"2026-08-05T13:47:01.053562Z","submitted_at":"2026-06-04T11:54:23Z","title":"Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:31:11.200818Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2606.06053"},"observation_digest":"sha256:81ef1e2db1bdf1a73c60637f103c6e76b73713c39f8b77a29d3a17b11f654490","observation_id":"d0ebe70e-8901-4f02-8446-3fcfbe42e772","resolution":{"observed_at":"2026-07-02T12:06:55.874192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-14T18:23:21.126826Z","title":"Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06053","last_updated":"2026-07-12T09:46:20Z","snapshot_observed_at":"2026-08-05T13:47:01.053562Z","submitted_at":"2026-06-04T11:54:23Z","title":"Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T18:23:21.126826Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2606.06053"},"observation_digest":"sha256:fdbcb094c8114b2660d8ac4d0c3bc0c5e7d87195fd8d9e307b1b0ca9617008f4","observation_id":"19cc1741-87fe-4ae5-8d02-0f82ff8b90a8","resolution":{"observed_at":"2026-07-14T18:23:21.126826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2312.00886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":186,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b7dead9405521f55cb5459cf02e89b37367a232fbdf052dbd5f7c5d9e47e9236","observation_id":"8106f321-7694-4ef0-89b1-a7aacf6a5055","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-02T08:40:54.271474Z","title":"arXiv preprint arXiv:2312.00886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:54.271474Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:781148f2e3af4f5527b2ff5c473593bb0ba3efedf74c36e3d7a774b9320f8c45","observation_id":"8fed52fb-1125-4a62-ab4c-a71d9d2971f5","resolution":{"observed_at":"2026-08-02T08:40:54.271474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-07-11T12:55:57.279598Z","title":"arXiv preprint arXiv:2312.00886 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04824","last_updated":"2026-07-06T08:57:30Z","snapshot_observed_at":"2026-07-11T12:55:53.730406Z","submitted_at":"2026-07-06T08:57:30Z","title":"Probably Correct Optimal Stable Matching under Two-Sided Uncertainty","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T12:55:57.279598Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2607.04824"},"observation_digest":"sha256:f4254f5c64d6982b64634da06f984230e61cf61e5fa9019c47c7925d2944a5a1","observation_id":"59004412-9117-4cb3-bc73-ab0efe768ff1","resolution":{"observed_at":"2026-07-11T12:55:57.279598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.00886/citation-record","integrity":"/paper/2312.00886/integrity","json":"/paper/2312.00886/citation-record.json","paper":"/paper/2312.00886"},"outbound":[],"paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","latest_version":4,"primary_category":"stat.ML","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2312.00886."}