{"as_of":"2026-08-11T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a8667aa542e3e6ec61a1a8f61b60b133f552126fe6142f2615ec69df2f52529","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:24:21.201297Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:40:08.618174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17696","snapshot_observed_at":"2026-08-04T17:40:08.618174Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10818","last_updated":"2025-09-13T14:35:51Z","snapshot_observed_at":"2026-08-09T11:51:27.807809Z","submitted_at":"2025-09-13T14:35:51Z","title":"LLM Enhancement with Domain Expert Mental Model to Reduce LLM Hallucination with Causal Prompt Engineering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:40:08.618174Z"},"links":{"cited_paper":"/paper/2412.17696","citing_paper":"/paper/2509.10818"},"observation_digest":"sha256:8c89171b6ff4737961321211c87af8d6b9aa9325e8207c87955dd24a0f8cba56","observation_id":"1256f83f-8b8c-48b4-952c-e40239160c53","resolution":{"observed_at":"2026-08-04T17:40:08.618174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17696/citation-record","integrity":"/paper/2412.17696/integrity","json":"/paper/2412.17696/citation-record.json","paper":"/paper/2412.17696"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:21.999876Z","title":"DPO and reference approaches For DPO we see a simi- lar derivation","venue":null,"work_id":"882caf6e-c4d3-407c-8d2e-8622f44f4c4d","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.201297Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:280fbc7bd2a0c3af3d72a9c947583ae378d7358f00b3910b4e1df216a64d8d01","observation_id":"d0a1f17e-f51c-40d3-8ab6-001ac9e1eba5","resolution":{"observed_at":"2026-08-11T05:24:22.006297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-10T23:26:33.935470Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-11T05:24:20.962220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.962220Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:bd23600fc87777bb8080f0bab2babdc25b6dc6b5033791ee7b0a5b2bc41d704c","observation_id":"0111fb54-4587-4207-b997-8cb7afef2f24","resolution":{"observed_at":"2026-08-11T05:24:20.962220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.577177Z","title":"Prompting is programming: A query language for large language models","venue":null,"work_id":"21bbb083-4894-4cb1-936c-92f32b76e977","year":1946},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.906537Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:6af3d2f06c902b253c2fb1254e4dbb91441275c1733b0d6bb3ccae57116e28e1","observation_id":"bf35de68-9326-4805-99dc-8c8d70e18ea5","resolution":{"observed_at":"2026-08-11T05:24:22.584053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.263873Z","title":"However, the semantics of the resulting formulas are less transparent and often hidden in the weights","venue":null,"work_id":"65822f00-40fa-4c4a-8022-28cd5f0a0177","year":2008},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.117785Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:4f2315e294d45cf1564c5c2b2a1379267e319077b2a13d845d30107ab35fe154","observation_id":"6ad0fa82-4bd7-4133-908a-cde191a52c5e","resolution":{"observed_at":"2026-08-11T05:24:22.269988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.245834Z","title":null,"venue":null,"work_id":"8af30117-3ab8-4f4b-a9f2-a80e76df5640","year":2018},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.132004Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:58947c34423413836719ab030ad51242d46506d0e38531824eb2785389457cf3","observation_id":"2d8a9011-4bef-4877-8b94-0c90a79650be","resolution":{"observed_at":"2026-08-11T05:24:22.251827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.287999Z","title":"(2024)), all of which were originally implemented using the logistic log-loss, i.e., each ℓx = − log σ(βρθ)","venue":null,"work_id":"15b02992-ca18-497e-a064-c68fdf32be28","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.109725Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:0875cad5f7b188e9980fc259753d0d9a12459b23d1af1fbd9f1a41a0d4a3be1a","observation_id":"5e46e22c-3252-447b-9901-8dcdbbbb3437","resolution":{"observed_at":"2026-08-11T05:24:22.299157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09521","last_updated":"2025-01-30T13:51:30Z","snapshot_observed_at":"2026-08-11T06:38:35.108145Z","submitted_at":"2024-05-15T17:24:34Z","title":"Declarative Design of Neural Predicates in Neuro-Symbolic Systems","version":3},"cited_work":{"arxiv_id":"2405.09521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09521","snapshot_observed_at":"2026-08-11T05:24:21.806909Z","title":"Declarative Design of Neural Predicates in Neuro-Symbolic Systems","venue":"cs.AI","work_id":"11840bdc-7b44-4f96-bcbd-8a95cfc91b36","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.948288Z"},"links":{"cited_paper":"/paper/2405.09521","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:aa727ddca920e1334643049235a8e88a729e679daf9b504c612156c9690d023a","observation_id":"c66a9439-ef3d-441a-b65a-e1e8c1fb8e9e","resolution":{"observed_at":"2026-08-11T05:24:21.814063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09072","last_updated":"2024-07-12T07:52:32Z","snapshot_observed_at":"2026-07-06T18:45:13.949715Z","submitted_at":"2024-07-12T07:52:32Z","title":"New Desiderata for Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09072","snapshot_observed_at":"2026-08-11T05:24:20.955189Z","title":"New desiderata for direct pref- erence optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.955189Z"},"links":{"cited_paper":"/paper/2407.09072","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:854b2dc2eca99819878e1126245b89616758990973a5b50031383b2d2d117da8","observation_id":"0c66f357-b5a3-40e5-9fa6-e302bcf1e5d7","resolution":{"observed_at":"2026-08-11T05:24:20.955189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.087197Z","title":null,"venue":null,"work_id":"627925b5-27ef-4f02-aabc-b829f6599509","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.181808Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:e84031f307ea4311776cc0b96ea811b19d62b92833ab05056ffc02ae26e13447","observation_id":"abb00165-1fc0-45e3-902b-a15b12efbb6e","resolution":{"observed_at":"2026-08-11T05:24:22.094340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-11T05:24:20.967825Z","title":"T., Moazam, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.967825Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:c5a33cdb0fba97cee52d69ee2366661a44891280218175638d10631b1cdb99d0","observation_id":"bce74ebd-ad1f-496b-b3b1-031884d5bdb2","resolution":{"observed_at":"2026-08-11T05:24:20.967825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-07-06T17:07:52.197869Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-11T05:24:20.973467Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.973467Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:35c1ce9c0dfa64f876a96acb43b5950945820f9ecacc8f4c3ede557cec41fe72","observation_id":"eafd6341-2023-40b8-b3e6-2f8de101f702","resolution":{"observed_at":"2026-08-11T05:24:20.973467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-11T05:24:20.993315Z","title":"Smaug: Fixing failure modes of pref- erence optimisation with dpo-positive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.993315Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:d71604625eb4c0742bbf281d3b05278d1af6b12918b8afeb849a730ede3044fc","observation_id":"abec1c88-e4f0-44a8-b698-8f6fa80a6cc9","resolution":{"observed_at":"2026-08-11T05:24:20.993315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-11T05:24:20.999144Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.999144Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:eba4ea92c0e8a5f0bb3be888e642e3c3c5d631b6dbde425dc3cbe92673e0a10c","observation_id":"06962f4c-82bd-4b5b-bec6-339adcad19d5","resolution":{"observed_at":"2026-08-11T05:24:20.999144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-11T05:24:21.004610Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.004610Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:eda49da934d1c6dc1d1f8a5418d61c8c20c1c77c5a560a43b84e223dedd2ce83","observation_id":"1a751ee2-beb9-44da-abe4-69ee1e1a6251","resolution":{"observed_at":"2026-08-11T05:24:21.004610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10650","last_updated":"2023-10-05T11:17:08Z","snapshot_observed_at":"2026-07-06T15:05:24.018286Z","submitted_at":"2023-03-19T13:03:51Z","title":"Logic of Differentiable Logics: Towards a Uniform Semantics of DL","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10650","snapshot_observed_at":"2026-08-11T05:24:21.018605Z","title":"L., Stew- art, R., and Stark, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.018605Z"},"links":{"cited_paper":"/paper/2303.10650","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:d17cf050e2cc0648cfe9433bb491d9211fd8608207ace6beeeea44cdfd282dba","observation_id":"4f5e94b0-964b-422b-95cc-a1d42b3718ab","resolution":{"observed_at":"2026-08-11T05:24:21.018605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08458","last_updated":"2024-06-07T15:10:50Z","snapshot_observed_at":"2026-07-06T17:59:21.208430Z","submitted_at":"2024-04-12T13:09:48Z","title":"On the Independence Assumption in Neurosymbolic Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08458","snapshot_observed_at":"2026-08-11T05:24:21.031248Z","title":"Uller: A unified language for learn- ing and reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.031248Z"},"links":{"cited_paper":"/paper/2404.08458","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:9f2e4e77c3d4ca44a638e75f05d03619ab38a9c37d2a6bac411a82075f04e57f","observation_id":"10e3b6cb-bd84-427e-8659-3fdf57c1791d","resolution":{"observed_at":"2026-08-11T05:24:21.031248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-11T05:24:21.038122Z","title":"Aligning large language models with human: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.038122Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:8458ad4c5e6afee916c280169cdeab2bfbaa8bb83f48705245d7fe8d26f6785d","observation_id":"284ccd89-8ef2-440e-bfc6-ee470834b2dd","resolution":{"observed_at":"2026-08-11T05:24:21.038122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-10T21:54:38.067043Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-11T05:24:21.054154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.054154Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:3f8193472ec01df953766d5d2bcfebaeb502e0d65aa1446f8cdd866cb7cb83a5","observation_id":"4901e4e7-b1e8-459a-bf61-8b71d7051ea0","resolution":{"observed_at":"2026-08-11T05:24:21.054154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19774","last_updated":"2025-04-07T06:11:54Z","snapshot_observed_at":"2026-07-06T18:38:21.977142Z","submitted_at":"2024-06-28T09:23:40Z","title":"Direct Preference Knowledge Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19774","snapshot_observed_at":"2026-08-11T05:24:21.060498Z","title":"Direct preference knowledge distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.060498Z"},"links":{"cited_paper":"/paper/2406.19774","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:be6113d7ae18452da7f9f249db0ea31df678a3d80766370e0a52bffc53587583","observation_id":"40eda98e-d5ba-4dc1-a581-bec958921811","resolution":{"observed_at":"2026-08-11T05:24:21.060498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-09T04:25:12.977504Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-11T05:24:21.066176Z","title":"Rrhf: Rank responses to align language mod- els with human feedback without tears","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.066176Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:3d943bee8db314f73a2754b055e27378ab67ec1287afca8a0b46cd81a6e4b6b7","observation_id":"850d7631-4d98-485c-b575-5144a537d229","resolution":{"observed_at":"2026-08-11T05:24:21.066176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-11T05:24:21.081152Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.081152Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:590b6887b19401b2ec78b28a2d5cd8da404482e6ed7bb82a7f87f7c8254140f2","observation_id":"288e9c2b-27e3-4ba6-a0e5-93f5ba2565a2","resolution":{"observed_at":"2026-08-11T05:24:21.081152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-11T05:24:21.087673Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.087673Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:4bf8d0ecb7983c12a71cdd97f3f99a83e179bbc0c4f65e26c4dd2a019cb5887a","observation_id":"07cb74ed-9771-4d1b-9b57-abe0b32ff339","resolution":{"observed_at":"2026-08-11T05:24:21.087673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.552331Z","title":"Original losses Further details of the original losses in Table 2, along with other variants such as R-DPO (Park et al., 2024), ODPO (Amini et al.,","venue":null,"work_id":"6417e586-478b-4a12-8318-b53d57a84822","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.094593Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:b5a0649669aaf291661e8dcf5f3a587ff12a63a8c255596cad31d01e6113290e","observation_id":"08ac64bf-a997-4ce5-8d86-31eba4898ee9","resolution":{"observed_at":"2026-08-11T05:24:22.561090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.314734Z","title":null,"venue":null,"work_id":"bcf38c89-0091-446c-bcc9-e438c95ef9ac","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.102120Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:c19e050db441255cfa23bd3915f5be0d3be5b693bdc77a46ff5abc18fd4d985f","observation_id":"79cc82fc-f00b-456e-ae12-ce0e46fa8dbc","resolution":{"observed_at":"2026-08-11T05:24:22.322172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.225070Z","title":null,"venue":null,"work_id":"c4625573-02bc-4566-9e59-f8d145a904c6","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.144992Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:c6c67f68f43122995037d264f8a251327bd279d5c8aeaea04713b1fe03a0c72d","observation_id":"760683a3-978d-4327-ae60-b26e18cb20ff","resolution":{"observed_at":"2026-08-11T05:24:22.231084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.196337Z","title":"Figure 8 shows the Boolean semantics of DPO/SimPO and some novel variants based on the ref- erence form of ORPO (ℓORPO-ref), qfUNL (ℓqfUNL-ref) and l5 (ℓl5-ref)","venue":null,"work_id":"ce902f4d-a6ab-45c1-8baa-8adfd4ed83b5","year":2017},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.153250Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:e42c4dd20b4e1efb952d7db177e40e093c570c4a602c74524ab32f193f9d68e5","observation_id":"dddd4f5a-9429-49cc-bc0b-28ae4e408065","resolution":{"observed_at":"2026-08-11T05:24:22.203410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.165465Z","title":"Specifically, we focus on losses around the known lossℓCPO, which we treat as a natural baseline to compare against","venue":null,"work_id":"03c838a6-eff3-4a7c-a574-363bbb6b1a02","year":2017},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.161667Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:2e37fdbfb4cf390bf2cd0eaab46c5109722582d45730b06a3f0d2fdc700321a4","observation_id":"df7b99b7-a451-476c-a0ac-ecfe48709ca6","resolution":{"observed_at":"2026-08-11T05:24:22.180401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.141766Z","title":"While these experiments are small scale and limited in scope, they are merely meant to suggest possible uses our frame- work and open questions","venue":null,"work_id":"4e55d9f6-fa06-436b-85bc-fbba09a06c5b","year":2023},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.168358Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:2cad0a9f4fc4eca40fefbf94183165e4eb0ad3bfc74628c815b0b9ad10288c9c","observation_id":"2df5a295-1b62-4a41-8878-ca9d34ff8621","resolution":{"observed_at":"2026-08-11T05:24:22.148719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.107526Z","title":"To avoid repeating the process of instruction tuning, we started from the trained Qwen model released in the TRL library6","venue":null,"work_id":"a3776d23-5de8-49f5-a799-5423ef7da865","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.175960Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:3a1ff7d768101a943c71272cf9a055a90263c6f955fe25d5ea3fa29112e407d0","observation_id":"277d8756-1265-4cb3-90e4-4bf1a4c3bef1","resolution":{"observed_at":"2026-08-11T05:24:22.115175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.054011Z","title":"This suggests that different types of preference data rely on a different semantics of preference, which requires a tuning approach that’s tailored to those differences","venue":null,"work_id":"191c8b00-37b5-4772-a123-e1e53922a89d","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.187556Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:3ba95e2696db1a4fe8f0b11245283325197306e9db30433c549c141412a52c0d","observation_id":"5e9f422a-dc72-4b1f-a4c9-e8100f6224a7","resolution":{"observed_at":"2026-08-11T05:24:22.060177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.025447Z","title":null,"venue":null,"work_id":"174215ee-cca1-4e56-ae3d-d9cbf75b1080","year":2021},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.194620Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:7948defe19a534ef88d77ca8db2f4a6a85ebef7978c160023cb2f9ca16952980","observation_id":"2ea43b70-4807-4d59-b405-1be9ba8fffb7","resolution":{"observed_at":"2026-08-11T05:24:22.035349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-11T05:24:21.075426Z","title":"Self-exploring language models: Active preference elicitation for online alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":1975,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.075426Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:f43ec7320940c44be0654a5c677f44d3fe65b5f8e8a039a25a4def381c276d76","observation_id":"7173bdc4-e1e1-48a7-85ae-4dbfe67fac49","resolution":{"observed_at":"2026-08-11T05:24:21.075426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-10T05:17:53.947932Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-11T05:24:21.023974Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":1977,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.023974Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:326cd8f577db85cc1e56b201fcd6df17d38031d1125989a43fdfe02c09048083","observation_id":"042ff44e-30a7-4c63-b41f-c437002ba784","resolution":{"observed_at":"2026-08-11T05:24:21.023974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10342","last_updated":"2022-07-28T16:51:14Z","snapshot_observed_at":"2026-08-07T23:10:07.678875Z","submitted_at":"2022-07-21T07:35:18Z","title":"Language Model Cascades","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10342","snapshot_observed_at":"2026-08-11T05:24:20.922116Z","title":"G., Wu, Y ., Michalewski, H., Saurous, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.922116Z"},"links":{"cited_paper":"/paper/2207.10342","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:9fbcb02014fc06c5e51d51e6a89ba99102199d66aa8ff48b32d3b66d82ada644","observation_id":"a7aefa3f-ddfd-4ddf-9c9e-581dfea35e95","resolution":{"observed_at":"2026-08-11T05:24:20.922116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14723","last_updated":"2025-02-08T16:29:14Z","snapshot_observed_at":"2026-07-06T18:04:08.777507Z","submitted_at":"2024-04-23T03:55:01Z","title":"Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14723","snapshot_observed_at":"2026-08-11T05:24:21.012067Z","title":"Insights into align- ment: Evaluating dpo and its variants across multiple tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.012067Z"},"links":{"cited_paper":"/paper/2404.14723","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:abfff60846a2a3176f0ba05135df9f59e4528f6a323c06272b5470179047226f","observation_id":"9b9b2a69-ef90-4f56-89ff-cc6b22f408c4","resolution":{"observed_at":"2026-08-11T05:24:21.012067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08609","last_updated":"2018-08-26T18:36:20Z","snapshot_observed_at":"2026-07-06T06:57:29.261455Z","submitted_at":"2018-08-26T18:36:20Z","title":"Adversarially Regularising Neural NLI Models to Integrate Logical Background Knowledge","version":1},"cited_work":{"arxiv_id":"1808.08609","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.08609","snapshot_observed_at":"2026-08-11T05:24:21.662964Z","title":"Adversarially Regularising Neural NLI Models to Integrate Logical Background Knowledge","venue":"cs.LG","work_id":"5b7296c6-f290-4034-8f57-ba23a3e7c0f6","year":2018},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.980347Z"},"links":{"cited_paper":"/paper/1808.08609","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:0f4d09a1318ef48f4a7381220edae461d6320508ad2769659ce51a539fea4756","observation_id":"5008a5d1-b1f4-4458-9452-ba3077d2eac9","resolution":{"observed_at":"2026-08-11T05:24:21.671331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19133","last_updated":"2025-05-30T23:40:44Z","snapshot_observed_at":"2026-08-06T16:11:49.973896Z","submitted_at":"2024-10-24T20:04:15Z","title":"Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19133","snapshot_observed_at":"2026-08-11T05:24:20.987102Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.987102Z"},"links":{"cited_paper":"/paper/2410.19133","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:b15e2fec6d31a86d9a68fc40bd589bbd9d3c8f9e0c2c1da3f7dc66d0ed9f3c6b","observation_id":"a47bfd00-65e2-47a2-840c-31ccc875dd04","resolution":{"observed_at":"2026-08-11T05:24:20.987102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11564","last_updated":"2024-11-03T01:51:57Z","snapshot_observed_at":"2026-07-06T19:17:13.095667Z","submitted_at":"2024-09-17T21:28:51Z","title":"Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11564","snapshot_observed_at":"2026-08-11T05:24:21.046827Z","title":"I., Zhao, H., Das, A., Tang, W., Yao, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.046827Z"},"links":{"cited_paper":"/paper/2409.11564","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:bee13e9de9ff3906301bdf0eebdf6e08a69bbcd53deae966474a28508a412594","observation_id":"1ac67d50-851b-4d1c-bfda-2c50bd113595","resolution":{"observed_at":"2026-08-11T05:24:21.046827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-11T01:15:48.115059Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-11T05:24:20.892964Z","title":"G., Rowland, M., Piot, B., Guo, D., Calandriello, D., Valko, M., and Munos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.892964Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:12f32382318595d0e44d13c19b6db26d15a191f4482aa714c57488b8660efc83","observation_id":"a6df2947-5ffe-4330-ab02-943c86d44356","resolution":{"observed_at":"2026-08-11T05:24:20.892964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-11T05:24:20.937725Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.937725Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:b92e2150c064166224231ae1c62199f6dbc003e2435ef67d9767ad532cecc160","observation_id":"196dde86-df55-4ed1-a5cf-279d0f442537","resolution":{"observed_at":"2026-08-11T05:24:20.937725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08968","last_updated":"2017-05-24T21:34:14Z","snapshot_observed_at":"2026-07-06T05:44:09.511384Z","submitted_at":"2017-05-24T21:34:14Z","title":"Logic Tensor Networks for Semantic Image Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08968","snapshot_observed_at":"2026-08-11T05:24:20.929299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.929299Z"},"links":{"cited_paper":"/paper/1705.08968","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:179b58c7844d87a4140f0ee243fee46b86a739d3028d62f4a5646f07bf987ed6","observation_id":"f4ac2847-9f4d-432d-84e5-379e57c986ee","resolution":{"observed_at":"2026-08-11T05:24:20.929299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T05:24:20.900125Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.900125Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:d362841c95356e9fe76b94168561dae94d3c80e22b607e94d768639cbb7cbd4c","observation_id":"f56f1ffc-df57-47c5-93e2-aabd9cd11047","resolution":{"observed_at":"2026-08-11T05:24:20.900125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13724","last_updated":"2024-09-09T10:52:57Z","snapshot_observed_at":"2026-08-10T02:18:15.629511Z","submitted_at":"2024-09-09T10:52:57Z","title":"Logically Consistent Language Models via Neuro-Symbolic Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13724","snapshot_observed_at":"2026-08-11T05:24:20.914415Z","title":"Logically consistent language models via neuro-symbolic integration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.914415Z"},"links":{"cited_paper":"/paper/2409.13724","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:51205bfb6a63ec12edc8d34445a4c8651bae1d8a9ce7cbd9faadfa8a9284b11f","observation_id":"5efe21c0-8cd9-42a8-9303-558f084c5ea0","resolution":{"observed_at":"2026-08-11T05:24:20.914415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T05:13:18.253133Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2412.17696."}