{"as_of":"2026-08-12T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96bc2db7f7894cc488f4df5cfbf40769b46c25567a7cc3c973d42e860fbb24df","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:16:32.070018Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:17:46.012360Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:42:04.899091Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14516","snapshot_observed_at":"2026-08-08T12:17:46.012360Z","title":"Cal-dpo: Calibrated direct preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-10T00:38:40.529495Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:46.012360Z"},"links":{"cited_paper":"/paper/2412.14516","citing_paper":"/paper/2502.07599"},"observation_digest":"sha256:3b06b3c7aafd9b25052f84daf4757b4060c78c2f91d40c1c515c77f7f0967181","observation_id":"5983e2f6-f1c3-49aa-999c-9598cfd3d96f","resolution":{"observed_at":"2026-08-08T12:17:46.012360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2412.14516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14516","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"087dde41-7822-4206-a07c-a182f11003bc","year":2024},"citing_paper":{"arxiv_id":"2507.10722","last_updated":"2026-04-10T03:29:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-14T18:43:05Z","title":"Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:33.928616Z"},"links":{"cited_paper":"/paper/2412.14516","citing_paper":"/paper/2507.10722"},"observation_digest":"sha256:ac6deb2e44ddd4d6d43a961d3e5f46d63267d5514751a8de92397561e60193e8","observation_id":"4b664141-2b19-4be9-bc82-8fb1de2a8e68","resolution":{"observed_at":"2026-05-19T04:42:04.901351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2412.14516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14516","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"087dde41-7822-4206-a07c-a182f11003bc","year":2024},"citing_paper":{"arxiv_id":"2605.02626","last_updated":"2026-05-04T14:15:24Z","snapshot_observed_at":"2026-08-11T10:18:20.365451Z","submitted_at":"2026-05-04T14:15:24Z","title":"Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:13.659698Z"},"links":{"cited_paper":"/paper/2412.14516","citing_paper":"/paper/2605.02626"},"observation_digest":"sha256:3aea889301f3b6fc641ea7395c682d13d584ffed0883b8188b2f601ea6a4ccee","observation_id":"10e735fa-5805-42b3-a9da-57eff2c8f526","resolution":{"observed_at":"2026-05-09T06:20:41.691864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14516/citation-record","integrity":"/paper/2412.14516/integrity","json":"/paper/2412.14516/citation-record.json","paper":"/paper/2412.14516"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T12:16:31.787908Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.787908Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ce58660c7010de5b89b902fd2b361c6c4ab493fa29d67860a6dfada146cc498f","observation_id":"a3043f17-7c1a-4907-9627-c1f5b1960ec7","resolution":{"observed_at":"2026-08-11T12:16:31.787908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.792312Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.792312Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:775cab3a8569f84fcb61f48c429aee88358001dad2987ce0dedde55f892affc4","observation_id":"7a53bf06-8323-4cfd-805a-41592a79ce75","resolution":{"observed_at":"2026-08-11T12:16:31.792312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.795485Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.795485Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:4460e31df7aea06e5b11942d4689b437920bdcb335ca6bbbbc404c0c887d7632","observation_id":"f1c5331e-62a6-4b14-8f7e-9d06a1242baf","resolution":{"observed_at":"2026-08-11T12:16:31.795485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.798253Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.798253Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d54d4a9d20668d476cdd14931c7c5d6f091cd6524c9e633f1663e92d0b8e30a8","observation_id":"c21db7c7-e901-4ace-aa9d-f03d596f7616","resolution":{"observed_at":"2026-08-11T12:16:31.798253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T12:16:31.800935Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.800935Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e6e17815fdd40dddcef4f85bbf44e27890e507cf9fc334aea6fd59f2fcb8aced","observation_id":"4ab6c605-1107-4c47-ba23-174ba61bb750","resolution":{"observed_at":"2026-08-11T12:16:31.800935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.805323Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.805323Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:8184ce80469f1d6860397525d0d32f9cd799a18fc5686e146648f3642b643331","observation_id":"c2e03700-8331-4b9a-9237-0832dace122f","resolution":{"observed_at":"2026-08-11T12:16:31.805323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.809910Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.809910Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e1c243f47eebee14935714c19700785af3d39765d6402dc61949686387da719e","observation_id":"c8364072-296c-4bfa-9f37-7b5b687dd2c0","resolution":{"observed_at":"2026-08-11T12:16:31.809910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.813699Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.813699Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:f1f7950cc06fd9243af7096b2eff430ea7d896a78f52f56e19241fd71e0a1477","observation_id":"de430066-de2d-42a1-aab7-fe0e94031552","resolution":{"observed_at":"2026-08-11T12:16:31.813699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-11T12:16:31.816513Z","title":"Slic- hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.816513Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:9abbb9ff6fac787adc252c4e8638b911056c7ca084411b747323c9dedec34160","observation_id":"252bde81-682b-48cd-b034-cb66fe3413f1","resolution":{"observed_at":"2026-08-11T12:16:31.816513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14367","last_updated":"2024-06-02T22:00:42Z","snapshot_observed_at":"2026-08-12T10:37:41.978642Z","submitted_at":"2024-04-22T17:20:18Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14367","snapshot_observed_at":"2026-08-11T12:16:31.820225Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.820225Z"},"links":{"cited_paper":"/paper/2404.14367","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e984bc0c1e7f679d34bd2d95760be57a423187bed7b0ae754f5b107f6fb5c52d","observation_id":"1260564c-4074-4593-9df5-ec7ae10168ed","resolution":{"observed_at":"2026-08-11T12:16:31.820225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-11T12:16:31.823443Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.823443Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e977a357640d82c5b85d08a784bd478b0aa9436d8a7f6b6b0bab17f869ebce8f","observation_id":"d69ef4d6-85ad-494f-a7e1-c9a4554f450f","resolution":{"observed_at":"2026-08-11T12:16:31.823443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-11T12:16:31.827786Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.827786Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:57d82210f982cf963ded02dd6272c89a6d1e87dccad2546b03fc41a8157fed9b","observation_id":"99b3e0ae-f37d-4861-986f-cdd089439c71","resolution":{"observed_at":"2026-08-11T12:16:31.827786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.831179Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.831179Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a9ce6db9b274528a45d566292367ec7cf41590f676c9dc8fd1256de0bd40e4cc","observation_id":"6796dcc0-2ce7-4394-805f-483abf14982d","resolution":{"observed_at":"2026-08-11T12:16:31.831179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.709103Z","title":"Tl; dr: Mining reddit to learn automatic summarization","venue":null,"work_id":"e037d705-ca31-43b1-952e-35e912ec4e00","year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.834698Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:c2bb327d4f3b66d83721bfad33b99a7f51bd1a000411ba00289eb64c9e7b8d61","observation_id":"4cd60717-3a3a-459c-8c01-687001bbea5c","resolution":{"observed_at":"2026-08-11T12:16:32.711917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.838747Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.838747Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:11fd1ec0da841ab99f0fd9cc12ceceaa28c1d87a0fea950db053cac65e597a94","observation_id":"edadd08e-1c6a-43ed-998e-18509afea875","resolution":{"observed_at":"2026-08-11T12:16:31.838747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-07-06T16:55:53.666800Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-11T12:16:31.841413Z","title":"Nash learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.841413Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:86d9b5d9cf36c4194b66b229761a37ecefe1c706b53c67a22f6d01d9ff317476","observation_id":"65c40c16-36fe-473b-ad35-f090bd37ad5b","resolution":{"observed_at":"2026-08-11T12:16:31.841413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.697595Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":"e75a1369-d0ab-4df0-b50f-2f083c71460f","year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.844889Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d4068223d53a5145e2458b0ef119f0e068b9e0c5deb319876320de66cf3e6a2c","observation_id":"ec0e0994-acd2-4e42-a38b-9f8c176824b2","resolution":{"observed_at":"2026-08-11T12:16:32.700617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-11T12:16:31.847944Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.847944Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d02e36a394f5ad0c06b18bf0114d852cf0e636aef764f30d5d6657775915c8a1","observation_id":"70cce962-625c-40dd-ad7e-be59950a25ca","resolution":{"observed_at":"2026-08-11T12:16:31.847944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-11T12:16:31.851281Z","title":"Gibbs sam- pling from human feedback: A provable kl-constrained framework for rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.851281Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3ef5eee19b8443411cca5e667f722e58431f4b5d786fca63aa287851d2b0405b","observation_id":"0762ebe0-d00d-443c-ba4f-58f67230247e","resolution":{"observed_at":"2026-08-11T12:16:31.851281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-11T12:16:31.855210Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.855210Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:70ae91c0efef8ab6da65ea699ff075f5063f7d10029b66a4ec2c345a1c05f468","observation_id":"6819dafb-6643-4018-b926-430f6136ac17","resolution":{"observed_at":"2026-08-11T12:16:31.855210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-11T12:16:31.859337Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.859337Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:39bedf5696ef871bd3462ffab12390c17254682f483d9efacfc131ade10f8611","observation_id":"087d7327-30ac-4fe0-9c68-53e750be321b","resolution":{"observed_at":"2026-08-11T12:16:31.859337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.689967Z","title":"Simper: Simple preference fine-tuning without hyperparameters by perplexity optimization","venue":null,"work_id":"4d6ffea0-c70f-440e-ab31-dd5db206663d","year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.863229Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e18ae395298cf2172d6c4581887e16d98dd984d34a0d93d57567761d5f4b8328","observation_id":"a7690f04-8146-4675-90d9-319bb5331e75","resolution":{"observed_at":"2026-08-11T12:16:32.693022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10584","last_updated":"2024-02-25T19:15:26Z","snapshot_observed_at":"2026-07-06T17:04:09.326801Z","submitted_at":"2023-12-17T02:14:15Z","title":"Policy Optimization in RLHF: The Impact of Out-of-preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10584","snapshot_observed_at":"2026-08-11T12:16:31.865955Z","title":"Policy optimization in rlhf: The impact of out-of-preference data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.865955Z"},"links":{"cited_paper":"/paper/2312.10584","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:0661787d860b128487eeb66889f704c38597a4cc4e0d29b7a6adfbf145f9133a","observation_id":"07476bde-f31a-476d-8daa-12c33e203891","resolution":{"observed_at":"2026-08-11T12:16:31.865955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-11T12:16:31.868865Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.868865Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:82a15f3fc29a6159b5efafbb25ea09f8928d1d134bf10b049dac47d7bc397081","observation_id":"f3207bb2-2819-4a05-88bf-8338026d52c2","resolution":{"observed_at":"2026-08-11T12:16:31.868865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-10T03:27:36.910323Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-11T12:16:31.872076Z","title":"Provably robust dpo: Aligning language models with noisy feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.872076Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:b3d372137c4b7cfe1d8dd9a88e3107a16225154c8f32d1f8d3f09110bf283595","observation_id":"00fe9418-3368-48a4-9310-8b5c3d35de57","resolution":{"observed_at":"2026-08-11T12:16:31.872076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05369","last_updated":"2024-10-30T07:29:40Z","snapshot_observed_at":"2026-08-12T09:24:23.849303Z","submitted_at":"2024-02-08T02:58:47Z","title":"Noise Contrastive Alignment of Language Models with Explicit Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05369","snapshot_observed_at":"2026-08-11T12:16:31.875936Z","title":"Noise contrastive alignment of language models with explicit rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.875936Z"},"links":{"cited_paper":"/paper/2402.05369","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:68cc79abbcca7bfec46c3880965fb2e05705f03f247d57477158ec56395a1178","observation_id":"c89ca9c3-a17a-4814-871d-11c438522a3a","resolution":{"observed_at":"2026-08-11T12:16:31.875936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14228","last_updated":"2024-12-21T02:55:16Z","snapshot_observed_at":"2026-07-06T17:33:45.647306Z","submitted_at":"2024-02-22T02:20:08Z","title":"COPR: Continual Human Preference Learning via Optimal Policy Regularization","version":3},"cited_work":{"arxiv_id":"2402.14228","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14228","snapshot_observed_at":"2026-08-11T12:16:32.250860Z","title":"COPR: Continual Human Preference Learning via Optimal Policy Regularization","venue":"cs.LG","work_id":"fa84e49d-f13b-4e28-a061-ff664daaefc9","year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.879139Z"},"links":{"cited_paper":"/paper/2402.14228","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:deb8899e91d8483af7a36bce3fe7e2c8ac17597019eecfddf325fcd310e81d90","observation_id":"4960576a-471c-4581-801a-9b1107e24467","resolution":{"observed_at":"2026-08-11T12:16:32.256071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-08-09T21:25:39.237839Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-11T12:16:31.882201Z","title":"Towards efficient and exact optimization of language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.882201Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:9b54b2cc9f8e8b61108ca54280009d19bfeb929f1e429a6dff75899513b28a38","observation_id":"c4044b74-173e-4ab9-8a56-2590f91da535","resolution":{"observed_at":"2026-08-11T12:16:31.882201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.680913Z","title":"Noise contrastive estimation and negative sampling for condi- tional models: Consistency and statistical efficiency","venue":null,"work_id":"8327fc4d-5e56-41e3-998f-5c30e04a38f4","year":2018},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.885458Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:8715c6e8ce7de5d5bd5b27e9994b2cbe3595b240bfe5abaeafb3bb42766bf033","observation_id":"793ac3b3-1a83-4aea-9f02-c5230f473f25","resolution":{"observed_at":"2026-08-11T12:16:32.684069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-07-06T17:56:32.062035Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-11T12:16:31.888937Z","title":"Towards ana- lyzing and understanding the limitations of dpo: A theoretical perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.888937Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a5c18ceffda8e9d8b396e0abeccf22680ef4833c4eadbf52365db6515f446429","observation_id":"ea2b61fe-61ac-47a8-9026-a9ad5900318c","resolution":{"observed_at":"2026-08-11T12:16:31.888937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-11T21:48:23.224442Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-11T12:16:31.891745Z","title":"From r to q*: Your language model is secretly a q-function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.891745Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e7e296ec9a8df00d8ff19199508871de22607d55333bc988353d930fc282460e","observation_id":"53babd5a-45e5-4f9d-8b08-949cb10d1c75","resolution":{"observed_at":"2026-08-11T12:16:31.891745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-11T12:16:31.895081Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.895081Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:da648bb5c67ff79304f08568beb3fb7c39ce119bc373a965eb8235368d581fef","observation_id":"f4659949-2b58-4b5b-8532-ade787f3a012","resolution":{"observed_at":"2026-08-11T12:16:31.895081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-11T07:44:17.970436Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-11T12:16:31.898358Z","title":"Token- level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.898358Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:6de183445f6fc29f6a81baa07b47ff0c3c83198b34b3988d10fb360f9d5af0c3","observation_id":"df554fa1-4c4e-4e47-8839-3d33f48fea7a","resolution":{"observed_at":"2026-08-11T12:16:31.898358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.671098Z","title":"A general offline reinforcement learning framework for interac- tive recommendation","venue":null,"work_id":"e2a718cb-77d9-42fa-9367-42c3fd06246e","year":2021},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.903506Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e91bdc54d9015603e47fb34c7e3649e51e1ffb191bba45400b30b5db4852fdb4","observation_id":"1343b00a-f14a-4d03-ae9d-80f0692c6f1a","resolution":{"observed_at":"2026-08-11T12:16:32.674683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.661404Z","title":"On calibration of modern neural networks","venue":null,"work_id":"ed14f18e-7a9b-4833-9ae9-6177fe988d1b","year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.906673Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e47b3b086bc8ffe102fde5a74e34494dbfd223279f01409cce9f6ed3bf4cefb2","observation_id":"6f6fb95b-bc85-4058-9a5f-7997b2df7c71","resolution":{"observed_at":"2026-08-11T12:16:32.664634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.652354Z","title":"Scale calibration of deep ranking models","venue":null,"work_id":"b82e1b71-970c-47cd-9790-fc050896914f","year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.910137Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ada4f7c724ea0851a526fcbd7bb8c592152ef6c5c92d21479a302d3669340f67","observation_id":"64781a79-dc7c-4d9e-82a9-962a674930b6","resolution":{"observed_at":"2026-08-11T12:16:32.655401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.642018Z","title":"Calibrated model-based deep reinforcement learning","venue":null,"work_id":"5df55a62-72f7-4d12-9e8e-d1b8fe5c7396","year":2019},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.912682Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3ce350c10a06ef1255c5fefa15ff361c75200e17ea4bb97037994ea6f3d7dba6","observation_id":"dfdcb30e-710b-4eb5-9e07-495b1f6bcc7d","resolution":{"observed_at":"2026-08-11T12:16:32.646066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.916373Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.916373Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:85181e95cd9290f68c3683e49bbd728f656ad1edd833442e56c653c81a1986ce","observation_id":"5714eafd-90fb-415e-b599-e941e60eb9b0","resolution":{"observed_at":"2026-08-11T12:16:31.916373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13240","last_updated":"2023-11-22T08:57:55Z","snapshot_observed_at":"2026-08-07T00:41:33.190948Z","submitted_at":"2023-11-22T08:57:55Z","title":"On the Calibration of Large Language Models and Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13240","snapshot_observed_at":"2026-08-11T12:16:31.919947Z","title":"On the calibration of large language models and alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.919947Z"},"links":{"cited_paper":"/paper/2311.13240","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d8f4d12fb18653ea8940248d931b3e7cd27d19a7249e1e6e3a6651a14810e184","observation_id":"8437b2c8-1af5-4ddd-9ab1-d93fa3439987","resolution":{"observed_at":"2026-08-11T12:16:31.919947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-11T12:16:31.922990Z","title":"Language models (mostly) know what they know","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.922990Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:8a4eeee0e0179acf911d5b060a630b5bc7933deadd6bbecf754fa3965a4a2696","observation_id":"9312365d-b111-474d-b068-e16fa8b1bee6","resolution":{"observed_at":"2026-08-11T12:16:31.922990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.628116Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"45229159-a8bf-4b74-90e8-3cae9eb69e1b","year":1952},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.927134Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:837f7fd1e5ae81307916a3f19bf6abd90c6f93164f6654a0748fa55141fdc490","observation_id":"56d76232-f930-4dd0-af5b-52442956b335","resolution":{"observed_at":"2026-08-11T12:16:32.631213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-11T19:11:24.361261Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-11T12:16:31.930130Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.930130Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:b40ced8d670a2b9af5c75910dee04c598ae22ecd28dd5386c4fee491a180656a","observation_id":"83463c92-b4e6-4ccd-8540-2d4bb110ed37","resolution":{"observed_at":"2026-08-11T12:16:31.930130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10093","last_updated":"2024-10-14T02:21:29Z","snapshot_observed_at":"2026-07-06T19:32:46.742766Z","submitted_at":"2024-10-14T02:21:29Z","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10093","snapshot_observed_at":"2026-08-11T12:16:31.933188Z","title":"How to leverage demonstration data in alignment for large language model? a self-imitation learning perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.933188Z"},"links":{"cited_paper":"/paper/2410.10093","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:8d7ceb4a9aac8a5139172dd3c4cec8b6b72376e6aab03a9a886a5fbfd66cab4f","observation_id":"a4256de8-453d-45da-95c8-e554d4f05985","resolution":{"observed_at":"2026-08-11T12:16:31.933188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T12:16:31.937213Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.937213Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:f6ecda52dc5ec3d2380400d28835a95576951a82e4c79b4f1cf52182f06e9d76","observation_id":"0943c1fb-e0db-48ed-9cf5-9f167b4771ef","resolution":{"observed_at":"2026-08-11T12:16:31.937213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T12:16:31.940300Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.940300Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:7ffcf61f5778748f40c1049c4598af88b04f3aeef14fef28f9b1e0df7f6ee689","observation_id":"ac1a2811-daad-4d69-bb65-a0193be5fac8","resolution":{"observed_at":"2026-08-11T12:16:31.940300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.617364Z","title":"Openchat: Advancing open-source language models with mixed-quality data","venue":null,"work_id":"4156544d-50f9-440b-b344-8b1bb8bc1419","year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.944005Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:54e9769f3d2cc8a286bcec428d4e1c2f5d60bbe2d6df3e3d11270c2af152fd48","observation_id":"25e9db84-767a-48ea-b70d-e03cd68fe5a9","resolution":{"observed_at":"2026-08-11T12:16:32.621160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02231","last_updated":"2023-11-02T22:47:14Z","snapshot_observed_at":"2026-08-10T02:15:39.974235Z","submitted_at":"2023-06-04T01:59:40Z","title":"Fine-Tuning Language Models with Advantage-Induced Policy Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02231","snapshot_observed_at":"2026-08-11T12:16:31.947063Z","title":"Fine-tuning language models with advantage-induced policy alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.947063Z"},"links":{"cited_paper":"/paper/2306.02231","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d772e99d1dbadd04ded65597edfc61ed1961a4f87356be9a07a730d44e0c6fdd","observation_id":"84b5bfc4-f444-45dd-ac05-f508bab73996","resolution":{"observed_at":"2026-08-11T12:16:31.947063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.949861Z","title":"Machine learning: a probabilistic perspective","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.949861Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a0a87535dd046bf88448ae82459056b0727a45f7f6f1523aa43cd84a45f73ba0","observation_id":"fa582487-b8bf-4e08-9c55-7a73db68d3b8","resolution":{"observed_at":"2026-08-11T12:16:31.949861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09321","last_updated":"2017-03-15T22:55:17Z","snapshot_observed_at":"2026-08-12T04:36:10.372729Z","submitted_at":"2016-11-28T20:15:55Z","title":"Improving Policy Gradient by Exploring Under-appreciated Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09321","snapshot_observed_at":"2026-08-11T12:16:31.952713Z","title":"Improving policy gradient by exploring under-appreciated rewards","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.952713Z"},"links":{"cited_paper":"/paper/1611.09321","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:1c4c597ff7979068c2069ab0e083adcaff97728abfcaef80bc07c02f43d45fe9","observation_id":"42d83879-5ccc-4995-84eb-62af187d97d4","resolution":{"observed_at":"2026-08-11T12:16:31.952713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.599138Z","title":"Learning how to propagate messages in graph neural networks","venue":null,"work_id":"e8f2c603-ee28-436d-9170-4759a3b08d9d","year":1903},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.956300Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e6ef6dc92e1239f6bff21e2f628f407e9be85cffd5430bd689df864cff6e5474","observation_id":"2a03ab81-e9a4-4ed8-a15e-156dba954253","resolution":{"observed_at":"2026-08-11T12:16:32.602814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.588571Z","title":"Learning to generalize from sparse and underspecified rewards","venue":null,"work_id":"68c838a6-8fd5-4593-8aef-07e268805173","year":2019},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.958843Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:1cb0d6899a6cf2d672f4051cfbe0499b7fd607c7966d7b34c0cd110d5043f92b","observation_id":"00ecfb45-e50e-47c1-b8fa-c9e7af06eb87","resolution":{"observed_at":"2026-08-11T12:16:32.591645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.578266Z","title":"Decoupled self-supervised learning for graphs","venue":null,"work_id":"b5392fd2-e079-45ea-8c90-f8b28e0fec70","year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.961637Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:5dd5296daed21b1a1f720930ca71c436794482cb5fa095f0aacaba6c0f02d9ff","observation_id":"f71633dc-4925-4aad-8ec1-3b59b4422e85","resolution":{"observed_at":"2026-08-11T12:16:32.581460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-11T12:16:31.964333Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.964333Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:df81af1297371d8454babe2dac479990aca0e866eb2bba751832806c62c1cef2","observation_id":"f57ea6f7-d3af-4c71-b8aa-df3d3e2ac0ef","resolution":{"observed_at":"2026-08-11T12:16:31.964333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-11T12:16:31.967147Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.967147Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:26bab478491a75f34ecaba5532a97109df13cefc649d46d516e8272a1cb43e41","observation_id":"5a888593-3615-4760-a93b-621af2650ef9","resolution":{"observed_at":"2026-08-11T12:16:31.967147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-11T12:16:31.970515Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.970515Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e1a6638ff7366bdb34643b36190a0be97ca0325899d0910cf6dd59b3c80682d2","observation_id":"8842ab19-1cfe-4140-910d-d92946430a09","resolution":{"observed_at":"2026-08-11T12:16:31.970515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T12:16:31.973598Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.973598Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:134c779fbb51bcc53fd7dc4441cb688cb642ed0db02ca2f5f8cc240521bdb654","observation_id":"8a528a66-0fca-47d9-91f4-689ff083e0ae","resolution":{"observed_at":"2026-08-11T12:16:31.973598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-11T12:16:31.977059Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.977059Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ee10f5923a0e1c75a3d21c5028e6639096064aa483b95c88a7efc79e3322945e","observation_id":"53e1e8af-cde6-4422-ac5d-4e030c0db960","resolution":{"observed_at":"2026-08-11T12:16:31.977059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-11T12:16:31.980152Z","title":"Challenging big- bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.980152Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:7feb4abcc0c03a3ab68375c945a55b28405c3c2b2d5959b9a5ec02386b38e2cd","observation_id":"38d0ece0-5b9d-4acd-89ef-12140dc30d40","resolution":{"observed_at":"2026-08-11T12:16:31.980152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T12:16:31.983210Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.983210Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:cd1c4074697aa474db577b52e5c9fc172a1cef7d8684c67ed3951be2cb68f550","observation_id":"9f242457-b2f7-4380-9e7b-3bcb877d3602","resolution":{"observed_at":"2026-08-11T12:16:31.983210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T12:16:31.986326Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.986326Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:99e31c46977c98e5b60f15bb9dba296278fae3715a9d5b83789782283f735ffe","observation_id":"085c13ee-d299-423b-b2c1-408a20437e10","resolution":{"observed_at":"2026-08-11T12:16:31.986326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T12:16:31.989194Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.989194Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:aac6ecf61bbddd0426f6205e4e79d050ba7fdd39195ed2ac7e80f275b730622b","observation_id":"f68d5328-0d1d-41ed-86d2-480ad6135bdf","resolution":{"observed_at":"2026-08-11T12:16:31.989194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.991750Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.991750Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:1f9d7c9bb684067db73b1d21428122d6a7747eb96526b850d1c21c053148ec57","observation_id":"959e2286-93db-4f1d-bf5b-cc7288c8181c","resolution":{"observed_at":"2026-08-11T12:16:31.991750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.994540Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.994540Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:981bfa9728ee87f1d50b0ca45f05bf8e22eff27804469fec862a3db55465b05b","observation_id":"b5c75b4a-1225-4dd4-bbf8-58a1b9a2280f","resolution":{"observed_at":"2026-08-11T12:16:31.994540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.555220Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d7142039-0935-4be5-ae26-203e146c0527","year":2019},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.997113Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:4de85cf50f94261623b83511fba7b221236d34a0e47abed2afd069dcc8cabaf4","observation_id":"3eecb998-3173-402e-b8d0-ea74583ca919","resolution":{"observed_at":"2026-08-11T12:16:32.559450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-10T21:54:38.067043Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-11T12:16:31.999493Z","title":"Contrastive preference optimization: Pushing the boundaries of llm performance in machine translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.999493Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:50b5390ab0b296dcaa6cd3f76b4cb2b124f77561f296d603ccbbc35d1acb0390","observation_id":"d2f9f718-aa82-40fd-96c9-61af13d31330","resolution":{"observed_at":"2026-08-11T12:16:31.999493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.545897Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":"c98d81b9-6aea-4c02-bcb8-bbb945654ec9","year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.003524Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ef52d2cd51622e3b87a913bcd056c0709933c49faa1e9b8259fc31da28ac4d37","observation_id":"dc65e0f0-fbbf-4f39-a91c-6616e4399414","resolution":{"observed_at":"2026-08-11T12:16:32.549991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-11T12:16:32.006296Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.006296Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:bd42343c326c918e2edc86cd2aeb22b4727a1ecf361f5571dd4d27a6def11832","observation_id":"650830fe-ea77-4a4c-b4dd-a0dc74095e6d","resolution":{"observed_at":"2026-08-11T12:16:32.006296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.537004Z","title":"Information, divergence and risk for binary experiments","venue":null,"work_id":"4a9a5fd8-edf4-4a36-82c1-4c0486bfd0f3","year":2011},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.010038Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:0e5480b18285ae36bb4ce8682b7baccbc9109e8c10049d69a26eedf34cf2853c","observation_id":"33bd544e-d5b4-4168-b0a0-581e3d3d6058","resolution":{"observed_at":"2026-08-11T12:16:32.540757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.527105Z","title":"Reward augmented maximum likelihood for neural structured prediction","venue":null,"work_id":"112a29a2-6e77-41c4-8afe-973b80f4841f","year":2016},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.012829Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:76fd1944001549a092301161cfdc5ec1b74ad4abd7d3637ee542f476e70344fb","observation_id":"da37e0fa-1e0f-437f-9935-12465a4d6df0","resolution":{"observed_at":"2026-08-11T12:16:32.530302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.518078Z","title":"Clustering with bregman divergences","venue":null,"work_id":"36cc4787-286f-48d3-a539-e4ee88b3fe2b","year":2005},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.016829Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:60d0dab46d67beaaa60b7e45635932403302993b71f4850809cf708b9007d88a","observation_id":"05b24dda-9261-44f0-9a92-abeb00905921","resolution":{"observed_at":"2026-08-11T12:16:32.520990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-11T12:16:32.019439Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.019439Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:6cff528dd9ce46309fd5e6678f503331b5ebe20149811f7ae68fb9b9f081121f","observation_id":"41168029-a0b7-4045-82c1-31903ff9efa5","resolution":{"observed_at":"2026-08-11T12:16:32.019439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-07-29T18:39:02.141391Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-11T12:16:32.022520Z","title":"chosen” response and one of the remaining three at random as the “rejected","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.022520Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:9c15287346e70f5e4aee2a9a7d861f6d7e06f3385956a72023719499a0279275","observation_id":"484e4191-a869-4b78-bbf9-af172e8cac7c","resolution":{"observed_at":"2026-08-11T12:16:32.022520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.507909Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"6b4b0652-bfb4-41dd-83cb-b1a252acbe90","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.027443Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ad004075c335117bbed76671877307e6056c0993e2dcccb07015b590af0a7417","observation_id":"8210680e-89c7-418e-bff8-ce1a1fcc093d","resolution":{"observed_at":"2026-08-11T12:16:32.511971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.498874Z","title":"Limitations","venue":null,"work_id":"341fa0bc-17f4-4c33-b79f-9b8da5a86a41","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.030919Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ff5a53e9304635b454027b4944e869aa1be8859fefa6ae192774cc74600d1b31","observation_id":"26608078-d248-42dd-abf9-23a4eb8d7b11","resolution":{"observed_at":"2026-08-11T12:16:32.501635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.484629Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"47a7341d-67ef-48c4-945d-40657dc6ad4f","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.034227Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:36ea4b0946d9cb5795bbf75dc65c4701cd9f5c94dda2984f0ada0498bb675443","observation_id":"4884cd23-33a9-4595-8b34-3bae026efaf8","resolution":{"observed_at":"2026-08-11T12:16:32.489123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.473633Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"be087016-18f8-45a6-bad1-2e8d4ca58ce8","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.038330Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:b1bcf09ba172e6cc20543d298a742ec4998f17f3f2715457d0226141a1f0d03c","observation_id":"4826bd82-96f4-4751-875e-7cee43bda8b5","resolution":{"observed_at":"2026-08-11T12:16:32.476708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.463478Z","title":"• Please see the NeurIPS code and data submission guidelines ( https://nips.cc/ public/guides/CodeSubmissionPolicy) for more details","venue":null,"work_id":"c2a7e083-567e-4043-bd6f-64b81a8959c2","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.041960Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3b8012eec71e23dd119c6bdb00d3d65cfaea4492a0696b63b09c9932a02a8d61","observation_id":"c0db1cac-3a60-4de3-8d6a-1daad2ad7748","resolution":{"observed_at":"2026-08-11T12:16:32.467290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.452199Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"8942faa0-5694-49c1-916c-546824610b8a","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.044849Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e83a41a451389ac13ed063e6f7ee9415add2c94d8021f2586c17c9843fd5f849","observation_id":"aec86a50-2589-4464-aa65-e396144e2d65","resolution":{"observed_at":"2026-08-11T12:16:32.455381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.443244Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"ef831b96-e199-444f-82a8-81eba8eaba81","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.047698Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e555bf2bc8f2994f207db4d2b563d22adbc00602b8f2f34ef4eff8f3d59ecbcf","observation_id":"06642fd1-12b3-4dcd-bb92-f67df389f24a","resolution":{"observed_at":"2026-08-11T12:16:32.446467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.433038Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"1f659bef-863e-4c9b-b004-7f398f71689e","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.050305Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2e8cf53ee91b9a160c3c1bc7c38d881bcd82be5ff92e8c86371b997539365a90","observation_id":"28738ff5-4694-48a8-8d58-87fd63ab9128","resolution":{"observed_at":"2026-08-11T12:16:32.437364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.421717Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"9e592541-d379-4e63-93f8-2e80ed9352a3","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.052865Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:4624ed0bfb05ae65b156374222fa1ca44d25bba84517348d4dacea31d6d83146","observation_id":"30282f20-6d4c-4f28-aed4-c4af1e1fea3c","resolution":{"observed_at":"2026-08-11T12:16:32.426109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.409558Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"98c6324b-d07d-4c04-8ed1-5a70176015fc","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.055941Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:1bad35882543cbe7b7a9964ada46e4e342bfe1cde32659cb2c30be18fe75f47f","observation_id":"f9cea911-8a11-41e2-917e-369700efd3ee","resolution":{"observed_at":"2026-08-11T12:16:32.414192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.058383Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.058383Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2d6c6bdf10878de743080e6d3176678b4af85572c52d827a6a92ce6607ae9866","observation_id":"9bb2e117-02d4-49b7-b2ec-819966320e54","resolution":{"observed_at":"2026-08-11T12:16:32.058383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.394511Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"95bd1fea-3e12-49d2-bc5d-1f26765e0d5c","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.060850Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ccd3f771babd6088eb67d90a20d4440ebc20f1fadf89501a73573143b834b418","observation_id":"ea19d25d-37db-4e40-9eea-312ff696fdf3","resolution":{"observed_at":"2026-08-11T12:16:32.397363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.064064Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.064064Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:9a94a1cc3e58409a66f6cdc1a458dfc22360267572065f73de352f1f21e3d31a","observation_id":"76ebee73-8f0e-4919-9cc8-415d8e5c5bb6","resolution":{"observed_at":"2026-08-11T12:16:32.064064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.067064Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.067064Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:4a1e73eb53dd09c494bf786461dd0add4440a58f2cac467f158ba21b41342435","observation_id":"5df0804e-650e-45aa-91b6-34563bce2854","resolution":{"observed_at":"2026-08-11T12:16:32.067064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.372275Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"a557be73-672d-45a8-accd-80f9f0094326","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.070018Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a4aed3fdd0cf0a966af40c706a47c9da70c7f978f2d7e2fe6f35d7faefd2891a","observation_id":"ea1687f3-4a6e-4d5d-aeef-083d0bd918a7","resolution":{"observed_at":"2026-08-11T12:16:32.375743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T21:48:46.109109Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 3 inbound Pith citation observations for arXiv:2412.14516."}