{"as_of":"2026-08-08T04:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c31f264c19cc1bb0f50e1e4fe0e59f63209c4908ce108949a04730023b3ca3d","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:45:05.082364Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21395/citation-record","integrity":"/paper/2505.21395/integrity","json":"/paper/2505.21395/citation-record.json","paper":"/paper/2505.21395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:54.632371Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:54.632371Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:1649baf6241318f8804d4f2665df1572b94c9efb40d69aa5bc7dec5685e8fec8","observation_id":"22f83a12-a945-4a69-908e-4ab81863aa5f","resolution":{"observed_at":"2026-08-07T13:44:54.632371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T13:44:54.693724Z","title":"I., Jacobs, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:54.693724Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:50d7d2f32d29a732af5b531556ea3d2f6e75551cde4bb9729c6aabaa3eaa4c98","observation_id":"a060b2f6-9f79-45b6-ad81-05cac294c2fc","resolution":{"observed_at":"2026-08-07T13:44:54.693724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:54.808597Z","title":"M., and Sun, W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:54.808597Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:310c5b466055d04e67edea43614eb129115a5ac98b545a3d5c440596083c9825","observation_id":"45695cbb-b815-4b7c-91bd-efdc0d7692df","resolution":{"observed_at":"2026-08-07T13:44:54.808597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09681","last_updated":"2024-06-04T21:19:10Z","snapshot_observed_at":"2026-08-07T20:18:58.674105Z","submitted_at":"2024-01-18T02:21:06Z","title":"Harnessing Density Ratios for Online Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09681","snapshot_observed_at":"2026-08-07T13:44:54.889918Z","title":"J., Jiang, N., Sekhari, A., and Xie, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:54.889918Z"},"links":{"cited_paper":"/paper/2401.09681","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:1028feb41e5a84ef25508ce06dec85ee4084ad50e55557980636b6ed59fcda05","observation_id":"f2fea3a5-9512-4a06-9378-3726f05d2273","resolution":{"observed_at":"2026-08-07T13:44:54.889918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06571","last_updated":"2024-06-04T20:12:47Z","snapshot_observed_at":"2026-07-06T17:42:29.208344Z","submitted_at":"2024-03-11T10:14:06Z","title":"Scalable Online Exploration via Coverability","version":2},"cited_work":{"arxiv_id":"2403.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06571","snapshot_observed_at":"2026-08-07T13:45:06.303229Z","title":"Scalable Online Exploration via Coverability","venue":"cs.LG","work_id":"075e72ec-83b6-4230-b90a-935012f24ce5","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:54.982699Z"},"links":{"cited_paper":"/paper/2403.06571","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:304b3af492ad66ddcabee0d98c9a525f76b781bdbe6aecbf01a09b075cd00ea5","observation_id":"0e61b7ea-ceac-44e3-a682-6d065032228d","resolution":{"observed_at":"2026-08-07T13:45:06.394885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:55.055754Z","title":"G., Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.055754Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:704e05e08a9aaee165330af27e7048a9a471b6fa48dc722c453e548734db0a05","observation_id":"59df60b0-282d-45f0-881a-64d8913f321f","resolution":{"observed_at":"2026-08-07T13:44:55.055754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:55.169617Z","title":"M., Schneider, J., and Ng, A","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.169617Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:4be1081113c783737f2d615db103854bd2d7bff942a5c7ba950035f23a68a78b","observation_id":"84b05808-b330-4592-ab14-99f21e382e4e","resolution":{"observed_at":"2026-08-07T13:44:55.169617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T13:44:55.238757Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.238757Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:940901f33dcebbbc5367dc476dfa5f923ef4bfbc2aee4ac5a799b11b20dc51b4","observation_id":"63de237d-f678-4794-b06d-4da79c494ac9","resolution":{"observed_at":"2026-08-07T13:44:55.238757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T13:44:55.377088Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.377088Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:2961e5d712b569d4085b3d49eee912520ef6d1e3394faa7791ec259e12ca7a7d","observation_id":"cf6783ee-6407-423e-99ae-962abfa1c415","resolution":{"observed_at":"2026-08-07T13:44:55.377088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:55.517503Z","title":"Contextual bandit algorithms with supervised learning guarantees","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.517503Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:ce92a05ad645543c54d979761fc75373e45459e7bf7f28e9f4dd6bcabee9bfdd","observation_id":"14710f35-8db2-49c9-93e0-44bb0f7bd651","resolution":{"observed_at":"2026-08-07T13:44:55.517503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:55.605096Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.605096Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:6736df7a9a00d986f2afaf2fded7b6ac3be4b43bbaf200a32664bbf32d21e610","observation_id":"22a88ce9-3be9-4e59-bf16-9bcc8471aaa5","resolution":{"observed_at":"2026-08-07T13:44:55.605096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:55.718587Z","title":null,"venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.718587Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:95777318afb5f9eff3e3b0cd8e3acbdf15549c0b1cb38c5af85c0e4ec3de0d0d","observation_id":"240e18bc-3414-4dcc-84a3-ded8531ff22f","resolution":{"observed_at":"2026-08-07T13:44:55.718587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-07T13:44:55.826681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.826681Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:56e50223f32f4888415612313681038079eeacd6ea02438be9a78cc9c2e4c79d","observation_id":"a629e6ad-7be2-4c03-81fd-d1473e5d3b6d","resolution":{"observed_at":"2026-08-07T13:44:55.826681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08495","last_updated":"2024-04-16T17:36:39Z","snapshot_observed_at":"2026-07-06T17:59:21.208430Z","submitted_at":"2024-04-12T14:25:49Z","title":"Dataset Reset Policy Optimization for RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08495","snapshot_observed_at":"2026-08-07T13:44:55.917428Z","title":"D., Zhan, W., Oertell, O., Brantley, K., Misra, D., Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:55.917428Z"},"links":{"cited_paper":"/paper/2404.08495","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:2031ab6d8d3dbe863bf21d8454585808a703a4b931bf09e6887740c0e2bc9ac6","observation_id":"294d0f4b-5166-4dcd-8e91-7a8a6a731517","resolution":{"observed_at":"2026-08-07T13:44:55.917428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.010458Z","title":"Robust and private stochastic linear bandits","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.010458Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:74569add44ea3cc7e6ac48a1ad114d2082be78e7d5abbfbd1ab8e468b7baef9d","observation_id":"c63e23e4-6167-4dce-9523-9a09316c548a","resolution":{"observed_at":"2026-08-07T13:44:56.010458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.102692Z","title":"and Hsu, D","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.102692Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:015337a18448049cf47c9c49f74c94070212b10dee4682cd1408e8044b7482a5","observation_id":"51b7fda3-0a4e-485d-9cfa-2a913759b7d1","resolution":{"observed_at":"2026-08-07T13:44:56.102692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.239470Z","title":"and Jiang, N","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.239470Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:2538e72088e1099909b24e36d297d1c0f196aaca11c8ae1be89235ceb83cc2bc","observation_id":"404f5f1f-107c-481a-9b74-dff23f57bfc9","resolution":{"observed_at":"2026-08-07T13:44:56.239470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.337210Z","title":"and Sentenac, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.337210Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:0f999e339288bda5c421696fdedda0606bb17d8d3c7f88d1a78e1c1cd6e8fce3","observation_id":"3fe4d398-1f28-4680-b100-e0cb89748d74","resolution":{"observed_at":"2026-08-07T13:44:56.337210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.414470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.414470Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:34ad0438407c2fd5bdb4e0b3e50dd40a0661ff05b2217ae1003d56b438f33f0f","observation_id":"d938f58b-be16-4a0d-843a-81517f30b9b4","resolution":{"observed_at":"2026-08-07T13:44:56.414470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05772","last_updated":"2022-06-12T15:37:36Z","snapshot_observed_at":"2026-07-06T13:19:55.416375Z","submitted_at":"2022-06-12T15:37:36Z","title":"Distributed Differential Privacy in Multi-Armed Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05772","snapshot_observed_at":"2026-08-07T13:44:56.541880Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.541880Z"},"links":{"cited_paper":"/paper/2206.05772","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:ef72a32ba664e7ca6d2ffc12aa17e0fcce691d862110d05f47e4473b553d8608","observation_id":"e50edb24-1c97-49c3-b789-41f0bbd070c8","resolution":{"observed_at":"2026-08-07T13:44:56.541880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05567","last_updated":"2022-02-11T11:53:22Z","snapshot_observed_at":"2026-07-06T12:36:45.308097Z","submitted_at":"2022-02-11T11:53:22Z","title":"Shuffle Private Linear Contextual Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05567","snapshot_observed_at":"2026-08-07T13:44:56.606840Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.606840Z"},"links":{"cited_paper":"/paper/2202.05567","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:17035754bac01bd722d964e2594932cc9bd02af1d9ca555b59f121138a8c73e9","observation_id":"264da0f3-a7cb-455b-94c4-2314d2555433","resolution":{"observed_at":"2026-08-07T13:44:56.606840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-04T15:58:27.584901Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-07T13:44:56.673138Z","title":"R., Kini, A., and Natarajan, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.673138Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:1730db6e1eebc87514dcfc52ae1c5d3086a354c2323429da79c32f0c7a637c8a","observation_id":"c07e7b14-0763-4b65-88e6-5d97b0cb27d7","resolution":{"observed_at":"2026-08-07T13:44:56.673138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.734155Z","title":"R., Zhou, X., and Natarajan, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.734155Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:b3cad8af38a967945c6daf04dfe343578eda38d8330d5cc1d42ba88417ba3f61","observation_id":"05e2ec5f-65c4-4eb4-b309-760c60063db9","resolution":{"observed_at":"2026-08-07T13:44:56.734155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.793524Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.793524Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:830b53183bae65f3199999b4a251ad9889d6c9abcf867c340e44675df119aa85","observation_id":"a20de056-40a9-4f70-a0a4-d6ffa2a43c34","resolution":{"observed_at":"2026-08-07T13:44:56.793524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.852370Z","title":"and Du, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.852370Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f74b3771797540b8fa2db0e618288f89f963f62959458a3045f279bd78844e73","observation_id":"d34bfd27-8df7-4de2-aeec-e32b1e7132e0","resolution":{"observed_at":"2026-08-07T13:44:56.852370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:56.912450Z","title":"Minimax-optimal off-policy evaluation with linear function approximation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:56.912450Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:1da4261392f995c3ec67487ab743206b96ab0eb569e97bd883375da972965cc6","observation_id":"25e84e02-d205-473a-ac09-e48864c73dde","resolution":{"observed_at":"2026-08-07T13:44:56.912450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.002442Z","title":"Calibrating noise to sensitivity in private data analysis","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.002442Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:4e058bb661d8a0fcf8147b1c1dc889ea1cc986a155f9ae2e5f045bb44acc46bb","observation_id":"2fe68c96-036c-4c61-ba86-8735a69f9b79","resolution":{"observed_at":"2026-08-07T13:44:57.002442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06443","last_updated":"2025-04-27T21:07:19Z","snapshot_observed_at":"2026-07-06T18:43:22.614883Z","submitted_at":"2024-07-08T22:53:23Z","title":"Exposing Privacy Gaps: Membership Inference Attack on Preference Data for LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06443","snapshot_observed_at":"2026-08-07T13:44:57.064925Z","title":"R., Yun, H., Teo, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.064925Z"},"links":{"cited_paper":"/paper/2407.06443","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:cd9f562c4058e63b1bf5758ecaeb6b91e4c1382359d9945aefd59880ad145503","observation_id":"3280134e-d360-4f8c-a9b0-dbcfe4d6476e","resolution":{"observed_at":"2026-08-07T13:44:57.064925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.137384Z","title":"Importance-weighted offline learning done right","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.137384Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:88eb367bfd18ac46e03b07c9831b65e0a286602487228810c6b6b0a6e276898d","observation_id":"b8409717-f79f-4245-b9a6-2ea6febaafa3","resolution":{"observed_at":"2026-08-07T13:44:57.137384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-07-06T18:05:38.235450Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-08-07T13:44:57.195037Z","title":"D., Zhan, W., Oertell, O., Swamy, G., Brantley, K., Joachims, T., Bagnell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.195037Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:980525518922e86e6f960f3de5d37806522d33bcc36d9aa9ce988a56c36323bc","observation_id":"47c6f8f3-e850-427d-a039-f2b44a779a37","resolution":{"observed_at":"2026-08-07T13:44:57.195037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.243840Z","title":"Local differential privacy for regret minimization in reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.243840Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:c462c6a5b2dea98a5144d570ec47a9f62cafc590975c5ee84beb1746f716d7ce","observation_id":"eb4675ef-62f4-4075-aedf-98bf12cc7089","resolution":{"observed_at":"2026-08-07T13:44:57.243840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.323106Z","title":"and Hopkins, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.323106Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:b028378f2137f5d2d56cc8ec67f57ed0ae217c7145f4bcb1ef5c3e05bbe5203b","observation_id":"bc140ad7-f20b-4a3c-a01a-da6da7cd4447","resolution":{"observed_at":"2026-08-07T13:44:57.323106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.392906Z","title":"B., Kamath, G., Majid, M., and Narayanan, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.392906Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:cbf6a9dc1646b1e9ef676018b49c332922c807c1c2a79646442be0f24eb09e30","observation_id":"f12048df-d6ce-4d49-a913-cb2bba9b9466","resolution":{"observed_at":"2026-08-07T13:44:57.392906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T13:44:57.450115Z","title":"D., Sun, W., Krishnamurthy, A., and Foster, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.450115Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:e129947f8544539915a24c38004d71683b100c04904397574b58fcfd1bf3fa44","observation_id":"cf75a51a-b4c8-4e9d-8880-63e46bd00e07","resolution":{"observed_at":"2026-08-07T13:44:57.450115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.534624Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.534624Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:3ac0c27ca879e32a8195874386fd9ec7cffaef469c3bc119b00b680861f8255b","observation_id":"8b846a68-5427-4060-bbec-7f6dc4f75ef7","resolution":{"observed_at":"2026-08-07T13:44:57.534624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.616181Z","title":"Bellman eluder dimension: New rich classes of rl problems, and sample-efficient algorithms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.616181Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:5dd0cc6e52456d275d77d6088da1e94501fefe54bcc989d9361c3efa7d0982bc","observation_id":"bcdcba6a-9b70-4803-abe7-3893d49db018","resolution":{"observed_at":"2026-08-07T13:44:57.616181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.676519Z","title":"Is pessimism provably efficient for offline rl? In International Conference on Machine Learning, pp.\\ 5084--5096","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.676519Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:9aa9f49470aa6ed85b8e15f5ffeca1b5c46d6a15b717cd7edffc57c774688502","observation_id":"8020fbf3-3226-454f-882d-00ff24c036a2","resolution":{"observed_at":"2026-08-07T13:44:57.676519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.751781Z","title":"and Langford, J","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.751781Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:7d99c51f421d9850fc7c059d5c10f30e09a52ced7231b3964b95d2dc9f716fff","observation_id":"0ca989b1-0cf9-41af-b94d-c4c55d00eb5d","resolution":{"observed_at":"2026-08-07T13:44:57.751781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02670","last_updated":"2025-09-05T16:24:28Z","snapshot_observed_at":"2026-08-04T09:24:50.419580Z","submitted_at":"2024-12-03T18:44:19Z","title":"The Broader Landscape of Robustness in Algorithmic Statistics","version":3},"cited_work":{"arxiv_id":"2412.02670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02670","snapshot_observed_at":"2026-08-07T13:45:06.028456Z","title":"The Broader Landscape of Robustness in Algorithmic Statistics","venue":"stat.ML","work_id":"ed64e104-4c0e-4118-b06a-c429b1cedd99","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.815194Z"},"links":{"cited_paper":"/paper/2412.02670","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f4eac0f1bae1ed7c6a42e66769a13d5f12e0884a1033a9935a09c7b568eebb24","observation_id":"91464f4c-943b-4e25-b532-9f3ef1473a6d","resolution":{"observed_at":"2026-08-07T13:45:06.102730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:57.831953Z","title":"P., Lee, H","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.831953Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:da85823d67fbf2a45a4efb1397b12bc4d552012d237291fa116e690acaef98ad","observation_id":"14b5b11e-9475-4f5b-afa7-042b1927bccb","resolution":{"observed_at":"2026-08-07T13:44:57.831953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:13.337064Z","title":"and Brown-Cohen, J","venue":null,"work_id":"8374ca57-3e30-4513-9556-2bc757a81ca1","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.836692Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:a19734eb674929fd092ccb55ea056d6a94a08faef3a935b4cc28ca1bfb5f0aac","observation_id":"071cfa26-ec20-4869-b252-6081c14f389a","resolution":{"observed_at":"2026-08-07T13:45:13.444969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:13.109824Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation","venue":null,"work_id":"df37d200-831c-40ab-8112-bf2d02ace2dc","year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.840951Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:2d154156182f76c38a8732be080bcbac282a2ab62b771a1499fc4a97fae09584","observation_id":"ad056ec6-d3dd-492f-8217-2ca786e0b09a","resolution":{"observed_at":"2026-08-07T13:45:13.208728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:12.986710Z","title":"Differentially private linear bandits with partial distributed feedback","venue":null,"work_id":"d92a84f7-06ab-4bd5-9617-bec3ee992404","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.846124Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f1ba0614a612c1da7948280676549469a2ebd4534c0cfe0ad479ef41f86c0eb4","observation_id":"d9b1c00a-e13c-462e-b624-9bb8d9f8675d","resolution":{"observed_at":"2026-08-07T13:45:13.045189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:12.731551Z","title":"B., and Yu, Y","venue":null,"work_id":"2fab0508-7f6b-479b-8a6c-528c89f55492","year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.862941Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:e44e974abec4a3565deb33d2f20d57df9d9692d73611ec6669c64c7369837ddc","observation_id":"e2e13a3b-36b1-44a4-b8ba-79f9a6ba2927","resolution":{"observed_at":"2026-08-07T13:45:12.887776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-07-31T03:53:01.450978Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T13:44:57.881471Z","title":"J., and Liu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.881471Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:abf25b1906ad4124a1bdcbd80068b99a27775bf2e5d1333532070d2fc6e0f464","observation_id":"9d2fe920-b1a1-4ac1-acf1-4f5e463db2ba","resolution":{"observed_at":"2026-08-07T13:44:57.881471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-07T13:44:57.905368Z","title":"Provably mitigating overoptimization in RLHF : Your SFT loss is implicitly an adversarial regularizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.905368Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:54a6f89d75e195da7fe4f9ef31eb379233f92045cbdfc24fb3bfca766007381f","observation_id":"206d38f8-6001-4688-a32f-53524120eb29","resolution":{"observed_at":"2026-08-07T13:44:57.905368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:12.552940Z","title":"Y., Yan, J., Jayaraman, D., and Bastani, O","venue":null,"work_id":"fce9923a-9f23-4a75-b5a9-4f5623fc774c","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.963295Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:5e98e009c9a587d2a0e45d819d74b5ec918c24cb05db629ff078bd431d7fb0de","observation_id":"52856b81-da6d-4fc1-8ae8-d8eb8190a6cf","resolution":{"observed_at":"2026-08-07T13:45:12.640870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02433","last_updated":"2022-06-18T15:18:17Z","snapshot_observed_at":"2026-07-06T12:34:39.580403Z","submitted_at":"2022-02-04T23:25:03Z","title":"Versatile Offline Imitation from Observations and Examples via Regularized State-Occupancy Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02433","snapshot_observed_at":"2026-08-07T13:44:57.989120Z","title":"J., Shen, A., Jayaraman, D., and Bastani, O","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.989120Z"},"links":{"cited_paper":"/paper/2202.02433","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:536fafd9b64be0b0f41bdf6d8cf6a60ec6034b7cd32832ba0690087e779bdb29","observation_id":"bbd543d0-84ec-4ba1-afb1-dea967749296","resolution":{"observed_at":"2026-08-07T13:44:57.989120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06734","last_updated":"2026-06-29T20:55:26Z","snapshot_observed_at":"2026-07-06T17:28:14.770675Z","submitted_at":"2024-02-09T19:09:48Z","title":"Corruption Robust Offline Reinforcement Learning with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06734","snapshot_observed_at":"2026-08-07T13:44:58.018188Z","title":"Corruption robust offline reinforcement learning with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.018188Z"},"links":{"cited_paper":"/paper/2402.06734","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:97db1cdd3d939784affae731f7cbf07f69fb107815de94948d93f3dee4bcb269","observation_id":"b7b5f535-eca7-4929-b022-dd2a8c11a880","resolution":{"observed_at":"2026-08-07T13:44:58.018188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:44:58.067713Z","title":"and Talwar, K","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.067713Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:6b8b87c9b7c34d42706f342e622ede0b53da3365274d8873a6ed2229db335738","observation_id":"b1eb1efe-0e88-4f7e-b1e1-30674758ec0b","resolution":{"observed_at":"2026-08-07T13:44:58.067713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:12.308404Z","title":"and Thakurta, A","venue":null,"work_id":"cb4de940-73c2-49fa-9e64-445ae19bf883","year":2015},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.166200Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:1ae52b76e65f350ca7b8cf6100e1bc5b286292c0562765ec68b34c88acbf9d89","observation_id":"57dbc156-7351-41c5-a40d-874bdce57ac9","resolution":{"observed_at":"2026-08-07T13:45:12.445447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:12.126604Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":"e4ba19a5-f76b-4b55-9125-0fce48d6b2a1","year":2008},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.256381Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:0da2f8aa2f24bb577f883fa7b807f5cffc50f7d38ef53982c1500544e62ae753","observation_id":"d20f5511-e422-4b99-9a44-aa19f99bb3fd","resolution":{"observed_at":"2026-08-07T13:45:12.207803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-07T13:44:58.339973Z","title":"G., Rowland, M., Guo, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.339973Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:d845ff368f7b6b26c2ef0ac7322e25f0cae11a9bd2cf480bd4af3d75106b6ea0","observation_id":"4825c11a-6490-491e-817b-18b2bfbc143e","resolution":{"observed_at":"2026-08-07T13:44:58.339973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:11.867647Z","title":null,"venue":null,"work_id":"5c0d3f20-e575-4638-9b3c-29445128c057","year":1983},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.441762Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:4c4b44c3c9a532db09989efc2cfcef1f16a027f4d811e277ee4f41c33532355c","observation_id":"07f6a628-19e0-4ccb-8873-35e77c39a2fc","resolution":{"observed_at":"2026-08-07T13:45:12.005072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:11.704394Z","title":"ChatGPT : Optimizing language models for dialogue","venue":null,"work_id":"efb5f4a7-c5ac-459b-afde-5b04ec6a7611","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.569884Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f873dc3b3a78b534f5258f2eca3662b30cd39446bd450138cb470132fc4ef60c","observation_id":"1b7c65ef-b82f-4a21-8d04-b3f32a471f12","resolution":{"observed_at":"2026-08-07T13:45:11.754842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:11.491246Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"64d64e0c-cdb3-4819-9f85-f6cbcda59bbb","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.720589Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:ffa0fa4315180c95c676d311f01059259e68256c9a3bc47e941e53b8b42e1475","observation_id":"6f5f7b64-9e18-40d0-b252-5700b8401841","resolution":{"observed_at":"2026-08-07T13:45:11.599409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:11.252313Z","title":"and Wang, Y.-X","venue":null,"work_id":"a5d1b12f-83db-45b9-808f-97e23912fee6","year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.865665Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:03658364cdf529d8c44f027b2ac4168f42d54ebb2391bcb39bfcf32951c50c9a","observation_id":"14c19cfa-deb2-487a-959f-8f20c231999f","resolution":{"observed_at":"2026-08-07T13:45:11.361226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:11.060888Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"c12643e9-e856-4b1f-a86f-d7e7e1c22009","year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:58.994773Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:300dde6886347ae0d3236a8caed775b3d5636b66b2d76a41f4b84613b64633ef","observation_id":"9288cd28-495f-4282-b1f4-204b56685608","resolution":{"observed_at":"2026-08-07T13:45:11.164787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:10.757216Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism","venue":null,"work_id":"666c377d-eae7-4573-a8fa-f8a8b19426de","year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:59.170713Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:619222e3bf486e13d0719f119229f6ac8adb2c2c9325bb695c7724c4af82060a","observation_id":"3d0142a0-ccc1-4823-9912-5ef0c8bdf33e","resolution":{"observed_at":"2026-08-07T13:45:10.913677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.03121","last_updated":"2020-07-06T23:36:20Z","snapshot_observed_at":"2026-07-06T09:35:57.224581Z","submitted_at":"2020-07-06T23:36:20Z","title":"Multi-Armed Bandits with Local Differential Privacy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.03121","snapshot_observed_at":"2026-08-07T13:44:59.345604Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:59.345604Z"},"links":{"cited_paper":"/paper/2007.03121","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:38bb897ed14f791deafdacf449dd496a89fd4acda609b11392e1d386c5e71767","observation_id":"1bf8d535-f667-4f41-9793-1c298983eef5","resolution":{"observed_at":"2026-08-07T13:44:59.345604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1203.1007","last_updated":"2012-07-03T13:48:40Z","snapshot_observed_at":"2026-07-06T02:44:02.909380Z","submitted_at":"2012-03-05T18:58:49Z","title":"Agnostic System Identification for Model-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1203.1007","snapshot_observed_at":"2026-08-07T13:44:59.521221Z","title":"and Bagnell, J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:59.521221Z"},"links":{"cited_paper":"/paper/1203.1007","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:5b67505ddc347ab48fc72bcd5708ba2d0d7a3a6f5502fed494186f633976a21e","observation_id":"4518b6ef-e776-4b72-8342-f7fcb33ae2f4","resolution":{"observed_at":"2026-08-07T13:44:59.521221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T13:44:59.736916Z","title":"Direct Nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:59.736916Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:85fc461b42164b0ea1bd85a97614cc885ffc1bc6f646872bf4cd65e9d74b5b57","observation_id":"2c612a59-241f-4f9b-a974-7f75e4c5f031","resolution":{"observed_at":"2026-08-07T13:44:59.736916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:10.555419Z","title":"and Sheffet, O","venue":null,"work_id":"79acfa87-5dfe-43f8-b655-1628db8eeabd","year":2019},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:59.899253Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:86dd7ee0d9217fa2e9b90076c8641d7e45b9c5e186f317811b47d6b0ec437644","observation_id":"cc91668b-e6fc-4d75-9fa3-64bededec017","resolution":{"observed_at":"2026-08-07T13:45:10.649260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:45:00.057955Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.057955Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:71c5eea3be63d27c480bac6346fd04669ec0838ba7065c4fca6da9c463b22528","observation_id":"08a18c92-2d24-44ba-aec1-fa6dbc4d9703","resolution":{"observed_at":"2026-08-07T13:45:00.057955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:10.323418Z","title":"and Sheffet, O","venue":null,"work_id":"195c688d-7524-4385-874a-22ace52e2d06","year":2018},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.151879Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:0a4abdc7a1f9c1fb22fe66a713531d836a0649efa62b8e206ba4cf833297f087","observation_id":"39eca17c-cd02-4985-94a5-84b9be50371e","resolution":{"observed_at":"2026-08-07T13:45:10.438346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01392","last_updated":"2023-01-03T23:52:16Z","snapshot_observed_at":"2026-07-06T14:37:16.907677Z","submitted_at":"2023-01-03T23:52:16Z","title":"Benchmarks and Algorithms for Offline Preference-Based Reward Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.01392","snapshot_observed_at":"2026-08-07T13:45:00.273913Z","title":"D., and Brown, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.273913Z"},"links":{"cited_paper":"/paper/2301.01392","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:b627ad7118b2ffcf0e8271571e2096de9490a09c1520092d507d85a336c36f94","observation_id":"876b151e-b9d3-4fb6-92b3-4596e38486f6","resolution":{"observed_at":"2026-08-07T13:45:00.273913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T13:45:00.439564Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.439564Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:74e3b40a3343a57ec82fe350414ed79c5b346581491b3920f4b179e0bf74d9f1","observation_id":"e7753a3a-af6e-4cb7-ab0c-504b6df18e02","resolution":{"observed_at":"2026-08-07T13:45:00.439564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:10.188595Z","title":"The importance of online data: Understanding preference fine-tuning via coverage","venue":null,"work_id":"b6c96052-536a-4481-a002-4b4ee362f1e3","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.549181Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:18a95c2623a6955d016d4c42ed650fa074d8eb58e2538f5e078d661bc03f3e2b","observation_id":"00b963f3-8f72-48a2-a7b2-787bae6547ce","resolution":{"observed_at":"2026-08-07T13:45:10.250643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:00.714395Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.714395Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f9376af6dcb7265d45f14678f247c956e168deb317939fdc298f38ff468635f5","observation_id":"a871c859-9728-4a2d-a6a5-96ddc928938a","resolution":{"observed_at":"2026-08-07T13:45:00.714395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-08-07T13:45:00.876180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.876180Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:02078de1944b2bdb9f98a856c8f03f5859f0c3d61897171a889bec120a80195c","observation_id":"349350fa-2915-4818-9aba-b70be6b32109","resolution":{"observed_at":"2026-08-07T13:45:00.876180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:10.014095Z","title":"Principle-driven self-alignment of language models from scratch with minimal human supervision","venue":null,"work_id":"1600a5e4-609e-40cf-8a3d-35df8b0287e2","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.019288Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:ed66c2d36fe966df36b044c12c38b4210eb4621968635bd8792bf96745daef19","observation_id":"cee8bc4a-7444-4747-8fa6-c8e6159e49cf","resolution":{"observed_at":"2026-08-07T13:45:10.086380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T13:45:01.173114Z","title":"S., and Agarwal, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.173114Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:2cd4582858ceccc5a8398ad0639ee7ccdb8cc46924c890007543b535066301ca","observation_id":"528e43c5-8c35-4cc0-81c2-71cccdb87003","resolution":{"observed_at":"2026-08-07T13:45:01.173114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T13:45:01.361604Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.361604Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:ad4fe17365d505f972d10319da368ffa82995b5a423975c7e6cf378f9832a2bc","observation_id":"31f00f59-19a3-4c2b-a2f4-8491679d2c76","resolution":{"observed_at":"2026-08-07T13:45:01.361604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:45:01.530685Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.530685Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f71c73a38ce28238b6fe473b9a145c7533999f3acaee6be3c629f871f82d5de5","observation_id":"f84149dd-0a3d-42b8-8d5f-c638c3e517b2","resolution":{"observed_at":"2026-08-07T13:45:01.530685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06226","last_updated":"2023-01-10T04:15:46Z","snapshot_observed_at":"2026-08-04T18:44:55.716082Z","submitted_at":"2021-07-13T16:30:01Z","title":"Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06226","snapshot_observed_at":"2026-08-07T13:45:01.676167Z","title":"and Sun, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.676167Z"},"links":{"cited_paper":"/paper/2107.06226","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:acca2876a4fa5ffb27437f5bfe9802f07377368d6c7561414d337f4d47749b31","observation_id":"32fd6239-8a15-4a5e-8b43-1d4eb839d10e","resolution":{"observed_at":"2026-08-07T13:45:01.676167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:09.843720Z","title":"Private reinforcement learning with pac and regret guarantees","venue":null,"work_id":"e165cd7d-4710-447f-8cca-d61e84934723","year":2020},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.801236Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:6c2a7b616de02d53b957e00deb1d53949ae09399bd068312463bc83e240a1fd1","observation_id":"13631173-84fa-4065-84da-7aa8bb414245","resolution":{"observed_at":"2026-08-07T13:45:09.913242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:09.669336Z","title":"TRL : T ransformer R einforcement L earning","venue":null,"work_id":"403abb52-4e0a-45a0-a4f4-3deef9eca7ef","year":2020},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.936084Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f5751c184085437d107554857024367f096e6804c22f83eadcd9558068566853","observation_id":"eb59928c-97bb-4b8e-80ad-1443f37636a1","resolution":{"observed_at":"2026-08-07T13:45:09.749209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T13:45:02.062867Z","title":"Beyond reverse KL : Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.062867Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:73321c71214fd75693d45a2bbc78afbee3b5508e1e7dd8d38f4ba28b0126dfdb","observation_id":"19ee0da3-f26e-4d8f-bbe5-0387e8bcc2fb","resolution":{"observed_at":"2026-08-07T13:45:02.062867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12799","last_updated":"2025-04-04T15:09:19Z","snapshot_observed_at":"2026-07-06T19:18:12.969683Z","submitted_at":"2024-09-19T14:10:38Z","title":"The Central Role of the Loss Function in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12799","snapshot_observed_at":"2026-08-07T13:45:02.217073Z","title":"The central role of the loss function in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.217073Z"},"links":{"cited_paper":"/paper/2409.12799","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:09d591195b250be20f33dcaa96a99cb0e82988428a0a7fb5b2e963f1e38210f6","observation_id":"6dcc33b2-c25b-4b26-9f24-290ac9944091","resolution":{"observed_at":"2026-08-07T13:45:02.217073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:09.450858Z","title":"Oracle-efficient pessimism: Offline policy optimization in contextual bandits","venue":null,"work_id":"2c270b90-74f7-4be6-9195-c4a854cb0cb0","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.369874Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:521a7aea6ba540e0a88c3386dc079ff9ef38c8ea7f0fc6a305a85cda8d95a5d6","observation_id":"408a1957-edf2-4e6e-a5c0-60f311fc7d14","resolution":{"observed_at":"2026-08-07T13:45:09.514295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14111","last_updated":"2023-11-03T18:36:03Z","snapshot_observed_at":"2026-07-06T15:46:21.260261Z","submitted_at":"2023-06-25T03:18:15Z","title":"Is RLHF More Difficult than Standard RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14111","snapshot_observed_at":"2026-08-07T13:45:02.561160Z","title":"Is RLHF more difficult than standard RL ? arXiv preprint arXiv:2306.14111, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.561160Z"},"links":{"cited_paper":"/paper/2306.14111","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:7287729b85c9d81f99b4ea435d0bf719ce759efabd81efa6cd0c181ef8dbf3d7","observation_id":"bc6e284f-0f30-4db7-b4a7-e9324e6af1ae","resolution":{"observed_at":"2026-08-07T13:45:02.561160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:02.755041Z","title":null,"venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.755041Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:02044f400457b8f97d7f94b76d208e599bd616e95428e93a25626bbb177e62cc","observation_id":"ef0913f4-fe91-46fc-8f3c-89eb5bc4d9c7","resolution":{"observed_at":"2026-08-07T13:45:02.755041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:09.258137Z","title":"On private and robust bandits","venue":null,"work_id":"26d38b89-2913-4800-b621-ce32d007190b","year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:02.884175Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:220ef926db67de70f82a7a5b46d1e1d90da5f0718ab6852873b3f6895500b2d1","observation_id":"38d55713-5938-490b-a9f4-e55aa35bebe4","resolution":{"observed_at":"2026-08-07T13:45:09.353478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T13:45:03.046755Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.046755Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:13f35c55fc22658d65dced869b19cd8781a1019fe38de4e060a223a779afddc6","observation_id":"d4a93fb1-1819-4d37-9e85-7a6155634ec4","resolution":{"observed_at":"2026-08-07T13:45:03.046755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:09.024819Z","title":"On private and robust bandits","venue":null,"work_id":"9efc9200-5272-47e7-9dda-f9277579027b","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.207476Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:d80f9d1fbf404f112c8cb8450d7e2c03bebc013aeff084e3326fec0a01824304","observation_id":"24c71555-cb6c-429e-81e9-b096df6f3489","resolution":{"observed_at":"2026-08-07T13:45:09.153167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16455","last_updated":"2025-08-25T01:01:38Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T07:00:05Z","title":"On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16455","snapshot_observed_at":"2026-08-07T13:45:03.350482Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.350482Z"},"links":{"cited_paper":"/paper/2405.16455","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:04b53cfa29b1c030cf623963e3c889fa3052c4a3fa850829725b21e7f29b37e4","observation_id":"2d05d8e8-2c3e-4b5a-81ae-0e73ee18c877","resolution":{"observed_at":"2026-08-07T13:45:03.350482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09223","last_updated":"2025-06-15T13:24:11Z","snapshot_observed_at":"2026-07-06T20:21:46.651618Z","submitted_at":"2025-01-16T01:03:56Z","title":"Foundations of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09223","snapshot_observed_at":"2026-08-07T13:45:03.495496Z","title":"and Zhu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.495496Z"},"links":{"cited_paper":"/paper/2501.09223","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:9a9bd420ee832e2a8c5843f30e7dfa4db9ba6f14e6dd5abf243df51e877129ef","observation_id":"c70c23d6-df86-41e0-8da4-2b2b588b97e4","resolution":{"observed_at":"2026-08-07T13:45:03.495496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:08.879779Z","title":"Bellman-consistent pessimism for offline reinforcement learning","venue":null,"work_id":"42dab1b8-cb89-460b-af12-9594aba72090","year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.635728Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:527ee3448581862d851b2a1addd888f3ed2c018d658936a1dfb344ba25cdeb1e","observation_id":"5f943956-9991-46a4-94aa-57ee8a6fb445","resolution":{"observed_at":"2026-08-07T13:45:08.964046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:08.631860Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":"0acacb15-0a13-4a6c-ac5f-93c663111b80","year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.708960Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:12b9feb270d1d79499688bf6c1180b6d09db8930d4b490ea2a2b0e05ca90f06e","observation_id":"47693abf-7fe6-4f98-9725-ed925a50e51a","resolution":{"observed_at":"2026-08-07T13:45:08.783637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04157","last_updated":"2022-10-09T03:50:05Z","snapshot_observed_at":"2026-08-07T04:06:44.777442Z","submitted_at":"2022-10-09T03:50:05Z","title":"The Role of Coverage in Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04157","snapshot_observed_at":"2026-08-07T13:45:03.851174Z","title":"J., Bai, Y., Jiang, N., and Kakade, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.851174Z"},"links":{"cited_paper":"/paper/2210.04157","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:91fbc9eb15e476ad8280a040dda26910e16ced93fb6c5ae73df10224385ba976","observation_id":"2c102604-556e-4131-b27d-df8e3dfe5770","resolution":{"observed_at":"2026-08-07T13:45:03.851174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-07-31T03:29:04.443362Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-07T13:45:03.971759Z","title":"J., Krishnamurthy, A., Rosset, C., Awadallah, A., and Rakhlin, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:03.971759Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:a56903a2f4d65c5115bb232b27714cefaea5fb71b1c1a8c561d48c6eb9d2bf2f","observation_id":"f24e11ad-5bc0-4e7a-a0df-1b77114804f8","resolution":{"observed_at":"2026-08-07T13:45:03.971759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06500","last_updated":"2022-07-14T22:14:17Z","snapshot_observed_at":"2026-07-06T11:57:21.548494Z","submitted_at":"2021-10-13T05:15:00Z","title":"Differentially Private Fine-tuning of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06500","snapshot_observed_at":"2026-08-07T13:45:04.056564Z","title":"A., Kamath, G., Kulkarni, J., Lee, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.056564Z"},"links":{"cited_paper":"/paper/2110.06500","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:0dec26672ba7e6eb1bd112e8f7c488dd3ae7eaf502b66cc246108c1a316128ee","observation_id":"1e623a67-03b9-4747-8d5a-b1b369fbcd82","resolution":{"observed_at":"2026-08-07T13:45:04.056564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:08.452069Z","title":"Offline reinforcement learning with realizability and single-policy concentrability","venue":null,"work_id":"2a1289ef-8637-4894-8d22-66ca87e124cf","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.163239Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f8440dbca4ee0f633fb0714bdd1d92902b7d893f37edb52dd7d14849096aeaee","observation_id":"99c7d7ac-d4bb-42ab-90b3-8e8cca818102","resolution":{"observed_at":"2026-08-07T13:45:08.527175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:08.194490Z","title":"D., and Sun, W","venue":null,"work_id":"eff00b7a-4435-43d9-be6f-82b1492d79f3","year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.365119Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:9b01646ff6ccb2faa555f61a22985cb654c6c8209d8bbe9bd743eb4d828cb54d","observation_id":"2a0bc272-c655-4f37-a4d1-9a8ef6274c35","resolution":{"observed_at":"2026-08-07T13:45:08.315920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:07.961520Z","title":"Corruption-robust offline reinforcement learning","venue":null,"work_id":"82175ccc-ac99-4534-b951-4bc39601bb47","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.456100Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:87e25053ff3e068d438daf1e6f7a152bcaf9a6d3c8fa6e633e224ede2cd33d11","observation_id":"13b583d9-506f-4e74-bd85-4e04f870217f","resolution":{"observed_at":"2026-08-07T13:45:08.096754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T13:45:04.554366Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.554366Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:97caa8f62f744750211014c3d7ec217d2f3741e1b5c45f79f7a25a36cd7305fe","observation_id":"0f25a33c-c908-4cf8-a2fd-d6b57a926c3f","resolution":{"observed_at":"2026-08-07T13:45:04.554366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:07.718289Z","title":"Locally differentially private (contextual) bandits learning","venue":null,"work_id":"ddcc0dbe-1eca-4c71-a255-488cfaaa927c","year":2020},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.710387Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:72b59259c72f71bb3e0f04f83063593e410328b97171a11fdf1a8067e4e275e8","observation_id":"b58fc734-8508-4caa-bbe5-520dddb3eb8d","resolution":{"observed_at":"2026-08-07T13:45:07.834248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:07.559453Z","title":"Differentially private reinforcement learning with linear function approximation","venue":null,"work_id":"76cf445a-8ab3-4084-80b7-4ec166f711ce","year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.842225Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:23d44e298e4842f7bb0a365c709b46d6ebec420dce0f1e8758180a469a076342","observation_id":"4b5a4910-4606-41c6-a9f4-f1cab496e3d7","resolution":{"observed_at":"2026-08-07T13:45:07.623841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:07.326002Z","title":"and Tan, J","venue":null,"work_id":"0a31f28f-5a16-4439-ada2-e1359947bfaa","year":2021},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.955804Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:255b40550c8560a116cc258523e617f416ad10d7e4d27f179f43c31b6d083765","observation_id":"8708e2fc-7628-4e8b-ad26-4173b24d4d05","resolution":{"observed_at":"2026-08-07T13:45:07.448453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:07.124345Z","title":"and Zhang, W","venue":null,"work_id":"51f32dd5-c135-4051-ab48-3d10cc59a717","year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:05.082364Z"},"links":{"citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:f5319868d612d20c98c9c76352c2eba33ea688aa619a81a074e9c9d142fb3999","observation_id":"a6de8d3e-efe2-4eab-93c7-daf7f2c38802","resolution":{"observed_at":"2026-08-07T13:45:07.202397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":68,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 0 inbound Pith citation observations for arXiv:2505.21395."}