{"as_of":"2026-08-08T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b09435fe016051263a56587ac8a1a14b7405146e77a406e27c8df72f5b33225f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:40:42.004209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:09:19.256384Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-08T19:40:42.004209Z","title":"D., Sun, W., Krish- namurthy, A., and Foster, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-08T19:30:36.087038Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.004209Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:a862cad279605ee40b55f348db7b7ab7919ea93ea13da7be4eb1c0cabac1d432","observation_id":"28b3bc5c-75f7-4b8e-bf00-8d71f0b107ff","resolution":{"observed_at":"2026-08-08T19:40:42.004209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T18:32:21.033460Z","title":"D., Sun, W., Krishnamurthy, A., and Foster, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-07T18:16:53.666488Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.033460Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:72a467042999069da9c1f138352e359f6e6062f50d5fb42c85730891bc551956","observation_id":"e3f076e6-6916-4baf-95d1-94ee9fcb0d54","resolution":{"observed_at":"2026-08-07T18:32:21.033460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T15:19:09.183433Z","title":"D., Sun, W., Krishna- murthy, A., and Foster, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15694","last_updated":"2025-05-21T16:07:47Z","snapshot_observed_at":"2026-08-08T05:51:01.468645Z","submitted_at":"2025-05-21T16:07:47Z","title":"A Unified Theoretical Analysis of Private and Robust Offline Alignment: from RLHF to DPO","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T15:19:09.183433Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2505.15694"},"observation_digest":"sha256:e1d4ac031bd301743e41b8237c892069a27626ac1729ee9983fbb734a33da10a","observation_id":"3e81486b-232c-4b7b-b93b-ba130a1d6d1d","resolution":{"observed_at":"2026-08-07T15:19:09.183433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T14:01:05.069235Z","title":"Correcting the mythos of kl-regularization: Direct alignment without overoptimization via chi-squared preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-07T13:49:33.928724Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:05.069235Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:c5dac967d76fb42fe89af2b4ec49627c3f935f9f08c0ba85694dfb62a9e77370","observation_id":"6c726fd7-51c0-4dcb-858c-88becab87c76","resolution":{"observed_at":"2026-08-07T14:01:05.069235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T13:44:57.450115Z","title":"D., Sun, W., Krishnamurthy, A., and Foster, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.450115Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:e129947f8544539915a24c38004d71683b100c04904397574b58fcfd1bf3fa44","observation_id":"cf75a51a-b4c8-4e9d-8880-63e46bd00e07","resolution":{"observed_at":"2026-08-07T13:44:57.450115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T12:49:08.217635Z","title":"Correcting the mythos of KL -regularization: Direct alignment without overoptimization via chi-squared preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:08.217635Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:6f1d0aa978f40ecc0a27dd4c5e3fe472b9a707ea2480d7573a78be5be8d91130","observation_id":"b55ea79f-9f8e-422d-bb49-586c347b5e54","resolution":{"observed_at":"2026-08-07T12:49:08.217635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T04:53:37.946422Z","title":"Correcting the mythos of kl-regularization: Direct align- ment without overoptimization via chi-squared preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09477","last_updated":"2025-06-11T07:43:33Z","snapshot_observed_at":"2026-08-07T04:44:55.497491Z","submitted_at":"2025-06-11T07:43:33Z","title":"On a few pitfalls in KL divergence gradient estimation for RL","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:37.946422Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2506.09477"},"observation_digest":"sha256:942278f413e2ccda1df97faf53cbad0461a7f51ba41a158daf1215798cff76ab","observation_id":"261636fd-99f3-48c9-865a-8eac72226e6d","resolution":{"observed_at":"2026-08-07T04:53:37.946422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:ac3744f366d62952aa82d8f8b8e0bd510866be6142a261125d78c4b5e20d57e7","observation_id":"ba6da69a-17ba-4890-9235-cc4380afde66","resolution":{"observed_at":"2026-05-18T14:02:39.869177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-03T23:08:50.379903Z","title":"Tenenbaum, and Chuang Gan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-07T07:35:15.256090Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:50.379903Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:7cf618c776cb6c9ec32e1fbac617b3283db1d8fc25b30e481e7cff64243ead36","observation_id":"684ffb9a-8e32-4797-9e20-825ddc225477","resolution":{"observed_at":"2026-08-03T23:08:50.379903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-03T14:03:35.433091Z","title":"Correcting the mythos of kl-regularization: Direct alignment without overoptimization via chi-squared preference optimization.arXiv preprint arXiv:2407.13399,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21917","last_updated":"2026-06-03T15:13:15Z","snapshot_observed_at":"2026-08-07T03:47:47.592130Z","submitted_at":"2025-12-26T08:22:41Z","title":"Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:03:35.433091Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2512.21917"},"observation_digest":"sha256:61a870a29fbc9fcc3fc69910349b319975187673bb55347de28063257c38f0fa","observation_id":"b0a0d9cd-8e8a-4aad-9c03-ab3df754fcbd","resolution":{"observed_at":"2026-08-03T14:03:35.433091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-03T05:49:24.742624Z","title":"Correcting the mythos of kl-regularization: Direct alignment without overopti- mization via chi-squared preference optimization.arXiv preprint arXiv:2407.13399,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01357","last_updated":"2026-06-08T05:19:57Z","snapshot_observed_at":"2026-08-08T01:13:19.346639Z","submitted_at":"2026-02-01T17:50:59Z","title":"Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T05:49:24.742624Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2602.01357"},"observation_digest":"sha256:88ac676a0a9fea5f39867d5c1e17f44cab82ceb75584de3257fa4f1ba42b033c","observation_id":"dd096e3c-077c-45c6-87a2-994515c96177","resolution":{"observed_at":"2026-08-03T05:49:24.742624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:ca0a933c02f92a4041e2f24b4f48386839a6e7b31454f04d9ac971f475adef61","observation_id":"9e48175f-fc46-4c2b-961c-e58cc24da00e","resolution":{"observed_at":"2026-05-16T06:37:28.570738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:6d84d45de5abdf507a502b51976e496aba40480242b711a007772d5b1d605221","observation_id":"793cd586-baf2-4a3c-b013-11bce3c0e45c","resolution":{"observed_at":"2026-05-21T13:10:10.400015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:6099577ce6af3506d6a3b6ca642458926c4e43fcc9d4675544b75555db813b35","observation_id":"f11d8a3a-a01a-40b3-872b-71693b7efc55","resolution":{"observed_at":"2026-05-09T06:10:42.400543Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:d168d8319435a949983bc9e42975e6cffc8860966df023d9ce38fa5cd99184e7","observation_id":"e3f67899-95f2-467a-8963-69b9da1675cc","resolution":{"observed_at":"2026-07-01T00:05:09.669377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:85fef2b4676a6d6c5e681de4342b7ea5bd1174e22b6f36315a2cd5967a889d3d","observation_id":"21ff4e1c-e768-4139-b5d8-986c02e676a9","resolution":{"observed_at":"2026-05-11T20:16:08.493642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2605.06977","last_updated":"2026-05-07T21:48:26Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T21:48:26Z","title":"$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:13:29.292351Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2605.06977"},"observation_digest":"sha256:82b348500323003bc02c5ff88a66ce80f4a5d727255b99f908d3948185116f38","observation_id":"95c21f44-3d62-4d8f-a099-d65dd3e4bfe9","resolution":{"observed_at":"2026-05-11T04:35:58.682722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2605.09214","last_updated":"2026-05-09T23:17:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T23:17:46Z","title":"Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:14.379908Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2605.09214"},"observation_digest":"sha256:99e398aff18f27240fab5fe71f09fa8689e8b00a9cf8ed105143c0d68b490a64","observation_id":"5ea18bdd-b9d6-4be9-877d-4dd67df471c0","resolution":{"observed_at":"2026-05-12T06:56:30.550722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2606.19607","last_updated":"2026-06-17T21:19:01Z","snapshot_observed_at":"2026-08-02T22:14:26.237081Z","submitted_at":"2026-06-17T21:19:01Z","title":"Which Pairs to Compare for LLM Post-Training?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T20:37:19.221848Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2606.19607"},"observation_digest":"sha256:c600f1f1a58f0001eeb5084a442310af7c2ffbd98f095a44e195879ac5003843","observation_id":"476175a0-9d98-4780-88c5-4ec70b1add6f","resolution":{"observed_at":"2026-07-04T01:09:19.259738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-02T10:01:58.145317Z","title":"D., Sun, W., Krish- namurthy, A., and Foster, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16240","last_updated":"2026-06-26T03:03:15Z","snapshot_observed_at":"2026-08-08T01:20:34.619049Z","submitted_at":"2026-06-26T03:03:15Z","title":"Normalized Rewards for Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T10:01:58.145317Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2607.16240"},"observation_digest":"sha256:e984c9efe4e0d3464731c0883906800ed5cc9e464bac1eaee7b10671147d4f96","observation_id":"6af3265a-6d02-463b-8756-65fbcb111345","resolution":{"observed_at":"2026-08-02T10:01:58.145317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.13399/citation-record","integrity":"/paper/2407.13399/integrity","json":"/paper/2407.13399/citation-record.json","paper":"/paper/2407.13399"},"outbound":[],"paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2407.13399."}