{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfc0ccf22bc08131f5c62259d60992006b93fa474b202fa38886e9a87b91f029","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:11:31.734703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2410.19471","last_updated":"2024-10-25T11:04:02Z","snapshot_observed_at":"2026-08-02T22:41:48.124142Z","submitted_at":"2024-10-25T11:04:02Z","title":"Improving Inverse Folding for Peptide Design with Diversity-regularized Direct Preference Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T19:03:53.675107Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2410.19471"},"observation_digest":"sha256:0e2e87df8cae35a660e2d99f0953bce6e04144cf391cb39713737b0ec79e71be","observation_id":"0c765219-aed3-4e29-b9f8-1d133a61dde1","resolution":{"observed_at":"2026-05-23T19:05:46.880609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T14:11:31.734703Z","title":"Beyond reverse kl: Gen- eralizing direct preference optimization with diverse diver- gence constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-07T14:05:00.257969Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.734703Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:ef5b856096c6e6155ad627b66f99aec49f8ebf8997d97d1c4187a6a42d5d932e","observation_id":"fe761636-83cd-4a26-a6ab-06a340bb0116","resolution":{"observed_at":"2026-08-07T14:11:31.734703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T13:45:02.062867Z","title":"Beyond reverse KL : Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.062867Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:73321c71214fd75693d45a2bbc78afbee3b5508e1e7dd8d38f4ba28b0126dfdb","observation_id":"19ee0da3-f26e-4d8f-bbe5-0387e8bcc2fb","resolution":{"observed_at":"2026-08-07T13:45:02.062867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T12:43:49.083529Z","title":"Beyond Reverse KL: Gen- eralizing Direct Preference Optimization with Diverse Divergence Constraints.arXiv e-prints, page arXiv:2309.16240, September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.083529Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:fa0c15ea9b17a034ecbcbd85bb87353bc34b52a25f602462e46a8f448cbcf8e2","observation_id":"76980b50-eb90-47f5-9a42-dc7bc440db34","resolution":{"observed_at":"2026-08-07T12:43:49.083529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:bbbeccc03fa584740f61e5041595a2b9f0f8bf876394ecb29c653bc573b27d7e","observation_id":"16949879-736a-40a2-b1a9-74e0f343206d","resolution":{"observed_at":"2026-05-18T13:11:24.039547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-04T11:27:22.818786Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints.arXiv preprint arXiv:2309.16240, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04773","last_updated":"2026-06-24T11:41:35Z","snapshot_observed_at":"2026-08-04T11:27:18.543408Z","submitted_at":"2025-10-06T12:49:00Z","title":"Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T11:27:22.818786Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2510.04773"},"observation_digest":"sha256:14c317c8e2bbd09ee4650b4a8b27c707ce9307e775d73da674710bed72d898d9","observation_id":"951663bd-9add-4f69-9910-0ce7a4bcc7e2","resolution":{"observed_at":"2026-08-04T11:27:22.818786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-03T14:03:36.093027Z","title":"Beyond reverse kl: Gen- eralizing direct preference optimization with diverse divergence constraints.arXiv preprint arXiv:2309.16240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21917","last_updated":"2026-06-03T15:13:15Z","snapshot_observed_at":"2026-08-07T03:47:47.592130Z","submitted_at":"2025-12-26T08:22:41Z","title":"Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T14:03:36.093027Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2512.21917"},"observation_digest":"sha256:f87ef12baaf4b5f6f7661e7bcc6effc0632dde162883e103c8bd429e670e8a2e","observation_id":"dfb966f1-9139-41de-8afa-bb2b116a9663","resolution":{"observed_at":"2026-08-03T14:03:36.093027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.00195","last_updated":"2026-05-11T12:48:16Z","snapshot_observed_at":"2026-07-31T18:51:54.041588Z","submitted_at":"2026-04-30T20:20:59Z","title":"Diversity in Large Language Models under Supervised Fine-Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-09T20:32:37.788283Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.00195"},"observation_digest":"sha256:c74ed6d22a596cb7aad44dc4cfe85c5eec7d469baa2e98ae5b298f289133e7d1","observation_id":"1fddb961-0819-47c9-b429-8a4ed6fc1a58","resolution":{"observed_at":"2026-05-09T20:37:32.126851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.00195","last_updated":"2026-05-11T12:48:16Z","snapshot_observed_at":"2026-07-31T18:51:54.041588Z","submitted_at":"2026-04-30T20:20:59Z","title":"Diversity in Large Language Models under Supervised Fine-Tuning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:22.314719Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.00195"},"observation_digest":"sha256:ca859b342710fdee422095e6d556414bd59bebd7afa7780cc09cc98996536515","observation_id":"19973347-87d4-450a-83c0-7911744b8fe1","resolution":{"observed_at":"2026-05-12T03:11:18.110302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T13:55:22.422923Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:b56e0e3a03d8c559b032be466981d123b2ba2999f5b0d37d24747e2e348a4d7a","observation_id":"ada1bef8-3067-4a22-9776-478fcd096770","resolution":{"observed_at":"2026-05-11T18:46:10.397358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-21T09:02:28.407064Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:819d0db09c7677de5e9f2edaadfbee57638a57596198ab46882b3c664df5c99a","observation_id":"326e914d-0920-427f-9129-5c084eb5195f","resolution":{"observed_at":"2026-05-21T09:04:04.467772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.06977","last_updated":"2026-05-07T21:48:26Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T21:48:26Z","title":"$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:13:29.292351Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.06977"},"observation_digest":"sha256:2fc8dc743f7c9dd6fc1640f40e425257f686df8d384a8b6036b9cbdb8eebe896","observation_id":"c695d87b-dea2-4534-a79a-71f609a6356b","resolution":{"observed_at":"2026-05-11T04:35:58.803821Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.09214","last_updated":"2026-05-09T23:17:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T23:17:46Z","title":"Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:14.379908Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.09214"},"observation_digest":"sha256:545e6bfcfa28f0dbaf9600a56f8c3c9120075fd732ab4e8eb0165295ec2bf0b3","observation_id":"220a304e-7a5e-4c27-91f4-1e32b9584b29","resolution":{"observed_at":"2026-05-12T06:56:31.019871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T07:03:00.503644Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:20b9b562c1d25f350760fcb0c9121a435eb7b50da260df375e55cedd021354cf","observation_id":"e0144991-53b8-4943-8b53-df773b4bd54a","resolution":{"observed_at":"2026-05-13T07:07:27.955425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T21:06:01.667173Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:28bd0756ced4a8d8d1f18e64f6c18ccb09fdcf6594fd463acbc7aaa6625b7577","observation_id":"0ba99aa1-1700-4fda-b7cc-82e8faffc46a","resolution":{"observed_at":"2026-05-14T21:19:28.247901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:64e29e15cfe9eb2d287c4034286df7d2968cbc4eebdfd7d234d47632c531cd11","observation_id":"243a7812-7707-4f01-a0f6-c10371f33d4f","resolution":{"observed_at":"2026-05-13T04:57:17.245928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:f8b08a785683db720c5a049a7a481d69d875d04646c2fff9b5848c40b6094cfb","observation_id":"c9f3e4ec-e3a0-4560-9122-0cf4de55d24c","resolution":{"observed_at":"2026-05-15T05:45:06.415473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2606.00306","last_updated":"2026-05-29T19:32:21Z","snapshot_observed_at":"2026-08-07T07:38:28.830163Z","submitted_at":"2026-05-29T19:32:21Z","title":"Rethinking the Role of Temperature in Large Language Model Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T23:25:55.849389Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2606.00306"},"observation_digest":"sha256:b5feb54b6b383248e2165cdc6bfaafbdd27c1b0397a9266c1a8719ca958c642a","observation_id":"6c795686-ad62-4af4-85df-7b8a941c1ae7","resolution":{"observed_at":"2026-06-28T23:42:50.064284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2606.05800","last_updated":"2026-06-04T07:29:43Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T07:29:43Z","title":"SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:53:22.159132Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2606.05800"},"observation_digest":"sha256:94ce358191338a40030f7a6cae43676d344cede88ed3688c462200d96a1a4df2","observation_id":"3c744dee-790b-4f01-b78a-8ec48199d654","resolution":{"observed_at":"2026-07-02T11:46:56.186095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":"2309.16240","doi":"10.48550/arxiv.2309.16240","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":"arXiv (Cornell University)","work_id":"97831535-3167-4b5a-93f4-144a495a40af","year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":189,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:74269eb0cf1171084bf006c740a174d631c8b95f21106a08655c11747dd9c617","observation_id":"d976553e-09a8-4127-a434-1fbf0a4f9173","resolution":{"observed_at":"2026-07-04T11:09:46.380972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-02T10:27:18.407194Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.407194Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:a7939b07ad6f4c86dc1d61bc9401ccf1f91fbe89c90026e17c964d927c5dbe9c","observation_id":"c6053d29-2b05-4f20-9194-e5acdafbac21","resolution":{"observed_at":"2026-08-02T10:27:18.407194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2309.16240 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:de1e6803182a451e00ee463646e0500e79dadbebca3faaf90710aac221f4dd1a","observation_id":"ff8e3dd2-af1b-4ce2-b914-fb03b68635aa","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-02T08:40:50.233277Z","title":"arXiv preprint arXiv:2309.16240 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:50.233277Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:8ae3db4647c78e412f54a2fda9b3218c9505d16c12b607bb1ffa990909c69c62","observation_id":"1d1df6fb-b34e-4886-bc4b-e260e9ca3516","resolution":{"observed_at":"2026-08-02T08:40:50.233277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-02T10:01:58.977272Z","title":"Be- yond reverse kl: Generalizing direct preference optimiza- tion with diverse divergence constraints.arXiv preprint arXiv:2309.16240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16240","last_updated":"2026-06-26T03:03:15Z","snapshot_observed_at":"2026-08-08T01:20:34.619049Z","submitted_at":"2026-06-26T03:03:15Z","title":"Normalized Rewards for Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T10:01:58.977272Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2607.16240"},"observation_digest":"sha256:a66d76e0776618aaede7dfcc8180b06928bb18036ded16e4164aaab164c2faa0","observation_id":"c8fc713c-d568-4789-a4ca-d889d967af12","resolution":{"observed_at":"2026-08-02T10:01:58.977272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.16240/citation-record","integrity":"/paper/2309.16240/integrity","json":"/paper/2309.16240/citation-record.json","paper":"/paper/2309.16240"},"outbound":[],"paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2309.16240."}