{"as_of":"2026-08-07T05:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:218120b0e1ccba03e475e4010f3c81224e753631c4cb1f6d83af965efc2b86c6","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:52:38.826438Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07855/citation-record","integrity":"/paper/2507.07855/integrity","json":"/paper/2507.07855/citation-record.json","paper":"/paper/2507.07855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.124912Z","title":null,"venue":null,"work_id":"f895c75e-2ce7-444c-9219-ace1f748dd66","year":2012},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.515815Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:464e1bdaaa044d1c36ea70575ac344ec2825df25696653cd472c756b739e709e","observation_id":"965346be-dd5c-4541-a403-540a244512fa","resolution":{"observed_at":"2026-08-06T18:52:40.129033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.06568","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.367526Z","title":"Alfano, S","venue":null,"work_id":"5a7c8cda-d730-4d07-b286-4f17edfbc1e8","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.577577Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:4611f1654d5f03c090c35eaf9147aad9f3ca9103a1f78e296962a31a73f5fcc6","observation_id":"81fccb27-e677-4950-bdec-22a72fff3fde","resolution":{"observed_at":"2026-08-06T18:52:39.375745Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.112453Z","title":"Amari and H","venue":null,"work_id":"e6ce5259-b0be-4683-8730-bbb0f5bb2f18","year":2000},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.693550Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:1d1fd2c15ac4f70cf5da5d0d405bee2d368ddf78918365df82c01a2148dd75b9","observation_id":"80ac216e-2012-4d87-b9ef-03a0217c83c2","resolution":{"observed_at":"2026-08-06T18:52:40.116234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.099590Z","title":null,"venue":null,"work_id":"bb55d944-fb33-46d2-b4d4-232bdd39b162","year":1971},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.787534Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:f702375b816b729797b2786af0498a9a4626e490ea155d0c754f0d0c75e43806","observation_id":"9a063b77-0699-426f-9c4c-ff02860b399c","resolution":{"observed_at":"2026-08-06T18:52:40.103357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.087374Z","title":null,"venue":null,"work_id":"f82a7974-59d9-4895-b462-9d127ec0be2e","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.863589Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:bb76e30b7636d087189b50e60d7693f5d01dab845130ec8e4abb33bd6aaf0069","observation_id":"d8a5099f-8521-45ab-8fd5-6f6d36949e01","resolution":{"observed_at":"2026-08-06T18:52:40.091265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.074694Z","title":"Bao and N","venue":null,"work_id":"7a934cb2-912b-4dc7-96d3-44bce6bca6d5","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.934402Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:24b3128c04b80acad4e8ec4e1a03adc64647d8d8df1832784f097cf4504dadf3","observation_id":"5acc9787-cfeb-4a03-a9ef-73a41d7caafc","resolution":{"observed_at":"2026-08-06T18:52:40.078926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.061833Z","title":null,"venue":null,"work_id":"983460db-401e-4194-bcd3-c24bc94b0473","year":1979},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.039406Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:fe6493fb39bdbd5101e149af63081372bd032d90d3ace13fb9a9b85d8f2005c6","observation_id":"75ca5948-f075-4972-aad3-1adc2626e9d7","resolution":{"observed_at":"2026-08-06T18:52:40.065896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.049643Z","title":"Blondel, A","venue":null,"work_id":"cfe483ac-12b2-4b8d-8433-c57f8c3e9c22","year":2020},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.197979Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:94204c095ff74ee26ca77c2be25b64ce4530d80f6c78992c89147f0c6158da6b","observation_id":"02724bf2-6657-422a-991a-34a97ae0e295","resolution":{"observed_at":"2026-08-06T18:52:40.053423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.036591Z","title":null,"venue":null,"work_id":"85428063-4ddf-42fa-968d-18f10616ba40","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.263682Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:a34b052c2d98cc843a3e6f41c80af69fcb743675fb8813352348c35039f4dff6","observation_id":"9f798169-da66-4976-988e-1f5427eabfa9","resolution":{"observed_at":"2026-08-06T18:52:40.040610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.023683Z","title":null,"venue":null,"work_id":"397355d6-baad-461c-ad10-cecec7b12cf7","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.366115Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:491d1833dff1b9b82dfd4f1e7095eddfd5b734a51422e3124625025914ecc72a","observation_id":"02b8a3f9-e2c3-4d3b-9b5f-1ec9f1231fd8","resolution":{"observed_at":"2026-08-06T18:52:40.027737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.009763Z","title":null,"venue":null,"work_id":"6af04504-9a69-45ed-b64e-1a83aed0e99b","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.469748Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:41ce21626b8307662a3d921fabb400bfbfd4c6e9c0dca106e15fda995e2329fb","observation_id":"98eb9345-e399-4045-bbdb-d7f2cdf0b977","resolution":{"observed_at":"2026-08-06T18:52:40.014204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.995194Z","title":null,"venue":null,"work_id":"ba9e20ca-692d-4d8d-b6fc-b68e9eee17ff","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.542796Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:1435981b334ff34649b75f1a7ba6d6f0b9f5090de56640c5bcf8dc3430a29c71","observation_id":"ec68244f-d308-4ea8-8d49-23025093a4f6","resolution":{"observed_at":"2026-08-06T18:52:39.999814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.981127Z","title":null,"venue":null,"work_id":"e7942087-6e70-4384-a829-5b6c6753cf0d","year":2007},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.639454Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:dc5e79103692a314af22b9b524c5bd89fc9861375b546ad0d34666e00977d25d","observation_id":"c8a8fa34-7bb3-4ca3-9565-c24ec8214238","resolution":{"observed_at":"2026-08-06T18:52:39.985297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.967293Z","title":null,"venue":null,"work_id":"a62a8fb1-3792-41f4-b4cd-637cc33b5e09","year":1958},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.793576Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:050230f44c3b74a22230e0599f35223cbb3433226cac1f7ed0542ece372a33a4","observation_id":"d5c96902-2571-47f1-997d-aba9d37f84e3","resolution":{"observed_at":"2026-08-06T18:52:39.971992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.954036Z","title":"Doignon and J.-C","venue":null,"work_id":"e6f355cb-a9e4-404c-9660-7c28cd319577","year":1974},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.870271Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:26b1b8965c31724aa5960e35f65520571beb96d95d56da84a58a6f4653139179","observation_id":"3aba22c1-3715-4e1a-8acc-44cf78ad5ff3","resolution":{"observed_at":"2026-08-06T18:52:39.958070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.941058Z","title":"Ethayarajh, W","venue":null,"work_id":"445af407-8f57-4cf7-baec-040bc0647fa8","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.946745Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:336461c1b94ed438d5b8b9f5bf746601ae39072108f18665a8a99f843f36aa68","observation_id":"e6e2ce3d-05c8-46d8-99fd-a7221203e38f","resolution":{"observed_at":"2026-08-06T18:52:39.945039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.927920Z","title":"Gneiting and A","venue":null,"work_id":"59d7056f-03b2-4686-8534-ed908a82e260","year":2007},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.057746Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:005df7bc08d426fa0d3184a3e3425cf9a2cee31207989ffbaf7eec36dfa2a269","observation_id":"b4cd4805-d636-4f9b-999f-2bf556a9bfbe","resolution":{"observed_at":"2026-08-06T18:52:39.931857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:52:35.156728Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.156728Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d49609ff8b7eb51ac6ac688872592e8ffcc4aad9c949409272183b248704424c","observation_id":"32cf51ff-128e-4429-903c-9e18fb93f4dc","resolution":{"observed_at":"2026-08-06T18:52:35.156728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:35.231062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.231062Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:635bfacd157d570c11cc7ee63164b038dd1e2d30202e3b94fe1dc614baa9028f","observation_id":"0b4a9192-b9bf-4986-bc94-d7c986731020","resolution":{"observed_at":"2026-08-06T18:52:35.231062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03884","last_updated":"2025-05-30T04:56:02Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T15:46:42Z","title":"AlphaPO: Reward Shape Matters for LLM Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03884","snapshot_observed_at":"2026-08-06T18:52:35.347941Z","title":"Gupta, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.347941Z"},"links":{"cited_paper":"/paper/2501.03884","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:8f9b2d71a0b6026064bbec60961346218f96665f209b4ef5fc8a62d761093e42","observation_id":"8a966e47-8557-4927-a89b-76ffe185a115","resolution":{"observed_at":"2026-08-06T18:52:35.347941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.905513Z","title":"Hastie, R","venue":null,"work_id":"f1ace3fe-a87d-4784-a2c7-62e097e4e502","year":2002},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.450714Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:051f2d23aacc7f6d02c24a9fbf603c8e201f5db7f5ddd94497ef062c7da9853e","observation_id":"0b463851-738e-4987-a460-caae629ac756","resolution":{"observed_at":"2026-08-06T18:52:39.909162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.892658Z","title":null,"venue":null,"work_id":"8196ca65-df89-4ed2-a8d7-ac26200931fc","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.600101Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:a3d1b4b1f9b7b9cfecef495dcbb4646941e903f91fd4c51b17de9cec18a4ab90","observation_id":"5229e8a3-3a7e-4622-99b7-61e3fb4701fb","resolution":{"observed_at":"2026-08-06T18:52:39.896574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.879699Z","title":"Huang, W","venue":null,"work_id":"e054ba7b-4dc4-4c2d-bb56-21274c9e5e28","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.670121Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:e77fb02420bf600f614e5d1a19c4a8a0a20cd72021e52640c18226f4749e4684","observation_id":"8a5b238e-5927-42cc-bb41-8ba86e955dda","resolution":{"observed_at":"2026-08-06T18:52:39.883467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-07-06T16:49:08.648847Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-06T18:52:35.793726Z","title":"Ivison, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.793726Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6c6b85f310fd13f6fbc63f978d67f1246d7bd486ef1d336a8919c1a12f5a1b94","observation_id":"f4ce977c-d379-4f66-ae69-9b6c4f9dd52b","resolution":{"observed_at":"2026-08-06T18:52:35.793726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.866132Z","title":"Kakade, A","venue":null,"work_id":"ecd0c3e8-594d-4feb-a830-2a1ca28ee710","year":2011},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.884856Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5f28128ee9417cc8d3f3ff515ff02e4977d84c0933f4d50922ac36d207468aea","observation_id":"54ec5f14-ff72-42b4-be43-e7ced6156b14","resolution":{"observed_at":"2026-08-06T18:52:39.870296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.852980Z","title":null,"venue":null,"work_id":"fd622a3f-d88d-47b8-ab1e-242fbf5f0fc6","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.950676Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:f7d4facc76770cd77b970a4a211608c6475f8589f00a2ec90f399b838381f28c","observation_id":"207c34d9-a568-4712-a475-d5c6144f41cf","resolution":{"observed_at":"2026-08-06T18:52:39.857109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.839848Z","title":null,"venue":null,"work_id":"6a42cd66-b30e-4b13-b42b-5168ed33bb14","year":1989},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.013640Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:9969fcc96958e077954c3cf76bbf6a94b5e5d96965baf2cd08645566403f3bc9","observation_id":"1a545f81-5c72-4731-a87e-71a3aea4a00b","resolution":{"observed_at":"2026-08-06T18:52:39.843801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.826190Z","title":null,"venue":null,"work_id":"ad1164a6-75d5-4522-bf43-58b2c0cf91ad","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.081485Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:e6ff3bc039ade33fcb0e9758271a8c0c255b5c24f64ea2e9c7c4927a12146e59","observation_id":"d2c9642c-e399-49e0-952e-8cf8db96b42a","resolution":{"observed_at":"2026-08-06T18:52:39.830449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19774","last_updated":"2025-04-07T06:11:54Z","snapshot_observed_at":"2026-07-06T18:38:21.977142Z","submitted_at":"2024-06-28T09:23:40Z","title":"Direct Preference Knowledge Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19774","snapshot_observed_at":"2026-08-06T18:52:36.169261Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.169261Z"},"links":{"cited_paper":"/paper/2406.19774","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:3231944512192d2300cd9af55da53bfeb040decbcf49f216fd864fe03c0e3b77","observation_id":"d31023e5-7897-444b-a6ca-3cbc8878500c","resolution":{"observed_at":"2026-08-06T18:52:36.169261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.813088Z","title":null,"venue":null,"work_id":"3a54cad7-fd8b-4f81-901b-704d14fd7a0d","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.262670Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:3c92ffc04c6f89f6744639a24f03ee190672f7b50dee528e25848d6d908172a3","observation_id":"90904036-3fb3-48b8-8851-53fe7c53e6a8","resolution":{"observed_at":"2026-08-06T18:52:39.817390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.800559Z","title":null,"venue":null,"work_id":"4cd65ac1-157c-4496-a1ce-0d8990afed1e","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.334781Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:15b50f4cfccbcda201b0e18de7a470a1a3ad175b642672f3edceb8bcd4409e21","observation_id":"8a726a5b-64ff-4d3e-b2b1-3d1b9561d547","resolution":{"observed_at":"2026-08-06T18:52:39.804388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.787693Z","title":null,"venue":null,"work_id":"d2af9cf6-6691-47e6-ac77-1ebb096047ba","year":1985},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.408635Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:dd6393f15d0f1f359ea3b1e2f8dba72ca69536d7ef10a0b48b173a95ef512072","observation_id":"84697ba7-17f3-401a-adc4-40948e8236d8","resolution":{"observed_at":"2026-08-06T18:52:39.791682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.774476Z","title":null,"venue":null,"work_id":"19aacd8b-8f4a-4b6e-a976-30c51d020eeb","year":2014},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.471253Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:8f11fd9f7f688011b698d5eb3d5499d814dc15dc4df78e7912f3ec837292b4be","observation_id":"8ba6d603-4793-466b-9b3d-f8b415ccc5aa","resolution":{"observed_at":"2026-08-06T18:52:39.778771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.761636Z","title":"McCarthy","venue":null,"work_id":"ec439419-ad07-4b7a-ad54-de2f63a3b49c","year":1956},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.561030Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:153f5e48d453e6c9d8acfa46d687c7fd01d7dac87d09e7bf8053590b124bb2c8","observation_id":"076ddc84-144c-4949-81a0-2359698b150f","resolution":{"observed_at":"2026-08-06T18:52:39.765690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.748949Z","title":null,"venue":null,"work_id":"7715ac8c-ff59-4f5f-b66f-d6e0a0acca2f","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.626119Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6bbedbbd0122b9acbe94006e812f7f286196680cc07c86ccc064b35e1266e3ef","observation_id":"30c1683d-dab5-4f38-9829-ae7326836ebf","resolution":{"observed_at":"2026-08-06T18:52:39.752867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.736484Z","title":"Mitchell","venue":null,"work_id":"fe5891c5-4fe2-4ca5-9070-039a6c209a1f","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.721352Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:f8a07b23704cea700c8040996275b38e5840bc821787234fd9737e6a6539081f","observation_id":"2d8a6005-dce8-457c-94ce-b0e00586c136","resolution":{"observed_at":"2026-08-06T18:52:39.740328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.722299Z","title":"Nock and A","venue":null,"work_id":"aef4f687-92ad-4b07-af6d-fead44394f26","year":2020},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.788286Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6bf6fa3999ec64ae7699140eb0cbc2c32c7350cc833e193873ddf621e0d4eb43","observation_id":"640d0667-d9b3-4cf8-a373-16a7155fd115","resolution":{"observed_at":"2026-08-06T18:52:39.726540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.709024Z","title":"Nock and F","venue":null,"work_id":"81a5dd24-3ae6-454f-8527-abd52c2b0841","year":2008},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.854967Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:ce821481dc13fa8ca9c47e8dc93d39853947007188b1170f6e3ded419dab992e","observation_id":"47acef93-28e0-467b-8706-75b236f882bc","resolution":{"observed_at":"2026-08-06T18:52:39.713336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tpami.2008.225","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.884196Z","title":"Nock and F","venue":null,"work_id":"225deaeb-6f2f-4e77-9bb9-c8ff8949b12f","year":2009},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.915265Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:10909edb11fe4e2ebada01a49a56e1a226ff55a97ea05a08c11ea348db84773a","observation_id":"19057d04-3f49-4fe8-a5dd-af41e8ea68d9","resolution":{"observed_at":"2026-08-06T18:52:38.889685Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.696114Z","title":null,"venue":null,"work_id":"9fc611a7-252d-4a7c-a9fb-fa07d445ffa6","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.001364Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:c804d0aaf660b163380d2965e898cb9ca74d107368efc430d2ea00833b881d1e","observation_id":"c59ab0c2-4ffc-48e9-ba54-f641f9820612","resolution":{"observed_at":"2026-08-06T18:52:39.699922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T18:52:37.079112Z","title":"Adler, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.079112Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:28136127ba40c2d4a945187a2d94a1fc3c5a7aa507169076cefc87be5ca1e0d3","observation_id":"d48ec375-fdcf-4214-8efa-b92bb651f903","resolution":{"observed_at":"2026-08-06T18:52:37.079112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.682386Z","title":"Ouyang, J","venue":null,"work_id":"c0510872-779c-484e-9538-831bd7176c38","year":2022},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.152941Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:1c3ecb83fae51c04c4dcc9703e51926d50de0bc60291fc7f749554b7630297f1","observation_id":"6d9a245f-f9fd-455f-8b32-49a6a3e425fb","resolution":{"observed_at":"2026-08-06T18:52:39.687241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.224508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.224508Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:b60b34a73c2a97ec0037c73059ecf529620882426f8b244da0f98579f7758c14","observation_id":"b96596a0-c6c6-45de-8988-40fcf3df7371","resolution":{"observed_at":"2026-08-06T18:52:37.224508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.668872Z","title":"Rafailov, A","venue":null,"work_id":"2be91e8f-0fa9-4698-8c86-6d794128b83a","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.280470Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:147a93ce25ae1fd510606ec0251943b239c182ff433512982d6dafa7c680bd9b","observation_id":"f56d7776-02e4-497b-9014-63d4212ff29a","resolution":{"observed_at":"2026-08-06T18:52:39.673035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.655215Z","title":null,"venue":null,"work_id":"a86dca0c-4698-40f6-a6e5-ec4603dd1213","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.389498Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:ffe1d164139279bbbaa3ab1ac77665ec883fa1c013428418b2585ab2a029356d","observation_id":"c9a5e42b-2936-4a46-93f6-1f6c17925fc3","resolution":{"observed_at":"2026-08-06T18:52:39.659448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.471398Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.471398Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:e1ac5beab5034747a1cb39b32ffe687db12ecb8b9d251ed8099ce4074a244921","observation_id":"4d5ac30a-a30f-43e0-915a-d8c703a5fb74","resolution":{"observed_at":"2026-08-06T18:52:37.471398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.535852Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.535852Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:0053b2f3ce02af52b6eefcc3ffe5f80917c6f91b530db23598533e5667adc749","observation_id":"cbb500e1-6af3-4c61-9eea-1934bd815d86","resolution":{"observed_at":"2026-08-06T18:52:37.535852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.642098Z","title":null,"venue":null,"work_id":"fd29cba2-dd99-4fdf-a332-b3bfd3b9f758","year":1971},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.599101Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:c8b3ccc89738244f6cf5e8460f7c7fc45f3ce3f7aca2bec99f608b617ee109a0","observation_id":"0d563e8f-888e-405b-992a-05b6de337c58","resolution":{"observed_at":"2026-08-06T18:52:39.646073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.629181Z","title":null,"venue":null,"work_id":"9736bb50-54c1-4c2b-a83c-0a0d6e87087b","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.665105Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:75e1564a1e2e1b10c7d836bbcf541ac1d2be25dcb66fa30816961115cf67d94f","observation_id":"ac251eed-27f3-4bb2-8ba0-6b38c10425e9","resolution":{"observed_at":"2026-08-06T18:52:39.633197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.615663Z","title":"Slocum, A","venue":null,"work_id":"e2740132-93c7-4682-9cd1-962d9abdbaa4","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.723880Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:be05a950bb05f8b39265d2f23f36230d6c5f8d9c333e1b350196df428eedb30d","observation_id":"3ce4ba05-615a-4030-be25-2691ab56a28b","resolution":{"observed_at":"2026-08-06T18:52:39.619757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.603278Z","title":null,"venue":null,"work_id":"248584f8-ac58-4672-b7c7-6731f349b697","year":2022},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.830259Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:9622fe09adc2a423c333a8777ddd1825778948efc3ea086522026bbc6cc144ad","observation_id":"8812f057-e68f-4d3e-b688-476d9e86ca73","resolution":{"observed_at":"2026-08-06T18:52:39.607057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.893399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.893399Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d1f31f002090a652499cf1ccf5a32b28e700637797ce454ff9bbac3e7e760733","observation_id":"bd040ad2-ddcd-4ea5-8881-49e96b1d3e82","resolution":{"observed_at":"2026-08-06T18:52:37.893399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.590635Z","title":null,"venue":null,"work_id":"ada110d7-1345-42eb-b85f-9da27cdeaf27","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.954555Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:7f1382fe8d5404c7a912376b5fcc40a663236cc768134be1369de1eb7c5415d3","observation_id":"dac90df9-7ad8-44c4-9c78-95413555e016","resolution":{"observed_at":"2026-08-06T18:52:39.594541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.575910Z","title":"Sypherd, R","venue":null,"work_id":"e93c6956-b41c-49d2-b088-e425257fbca8","year":2022},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.019369Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:dd1b4508f8f58e12dd480615408c426e481212054d9da4ae87158b40e3918968","observation_id":"7f341fc4-d89b-4a78-bcab-887fe94274b5","resolution":{"observed_at":"2026-08-06T18:52:39.580769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.562546Z","title":"Tunstall, E","venue":null,"work_id":"8637a019-6f47-46bf-8347-dc7e8949a0fb","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.147360Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:fe741dae8fbdd11bb809d326d83c59f222a7c67e011b294ed2166c098331630c","observation_id":"9daebe3b-71e2-4a3b-bbe4-99ffe76e8547","resolution":{"observed_at":"2026-08-06T18:52:39.566845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.547839Z","title":null,"venue":null,"work_id":"2f8435eb-fb5e-44b0-b83c-ea6569ef128d","year":2020},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.268692Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6a054f6e29236c81d5e9556ff9ff328b384a92e0370d85e1bdd08a1fd2d2f1e9","observation_id":"88ca329d-0891-469e-9bfd-9ba8e26cdf17","resolution":{"observed_at":"2026-08-06T18:52:39.553032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.534024Z","title":null,"venue":null,"work_id":"f62edf81-a8bb-4640-b34d-d665d6be3a27","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.437209Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:b492e6be610441c27c818e1d21ecb238293b949a7d067b9a724e5cfae9d7a77e","observation_id":"50fd11cb-35ba-45bb-bacb-9fb4b9a50010","resolution":{"observed_at":"2026-08-06T18:52:39.538286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.520397Z","title":null,"venue":null,"work_id":"2c434be5-5f2a-44c3-bd38-c3e65b111ccf","year":2016},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.563817Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:913a589b77838b76941d212a08684ef6f98c919f1e8a3642af01be5c5625c9de","observation_id":"bfc3f260-911f-4edc-ac4c-2c45d148e19b","resolution":{"observed_at":"2026-08-06T18:52:39.524264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.506959Z","title":null,"venue":null,"work_id":"35e263c6-e93a-41b8-8db3-ffda5e1f80ab","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.682104Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:9893a6a4de1f1fb4bfbb87c24c71fa377a7460c83f6e05147cbbdc6a96431ba1","observation_id":"adc61e49-10df-49f2-96e6-7f0df74fd2f1","resolution":{"observed_at":"2026-08-06T18:52:39.510989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.491745Z","title":null,"venue":null,"work_id":"a3d6075a-4035-480d-ba97-eebdd7575cc8","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.778837Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:cd8d0242a88ff024a93ce3e9bb2bcb4da2d51a600ba0b13568b53057467ca4a4","observation_id":"e22ddd89-11b9-4ec6-8db6-9870ea80c6b6","resolution":{"observed_at":"2026-08-06T18:52:39.496283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T18:52:38.783043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.783043Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:9ac0e7d5cd1eedfece7350265df06414cac49e629dbcededefeb858ca12f54d6","observation_id":"08a406d6-ea26-4385-ad56-1768411060d0","resolution":{"observed_at":"2026-08-06T18:52:38.783043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.475956Z","title":null,"venue":null,"work_id":"3c19a2d4-f1a6-48e8-94a2-a26529705733","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.787672Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:bd2017a177be20e432abcea66d0af21fa4e6ff704bee0851fddf6eae14de4740","observation_id":"87803603-1cad-408c-b14e-b59054fc6f47","resolution":{"observed_at":"2026-08-06T18:52:39.480895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.461188Z","title":null,"venue":null,"work_id":"4c2fff91-ef6d-466b-9174-e1c51b96a7e5","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.791473Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:8ffdf03a963bfaa8648184b010db26816a7c1ae63b72ec464765a35e065ded4c","observation_id":"0881ed7b-d103-4605-bd91-21ebd84de778","resolution":{"observed_at":"2026-08-06T18:52:39.465569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.446903Z","title":null,"venue":null,"work_id":"56ea8f5d-6609-4aae-b239-592e70462723","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.795690Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5462a262f222dc7544a710de18f4dbca9660dbfc7480ca4cbc7d26493855985c","observation_id":"ec96c192-f2de-446e-a537-58949b0618cb","resolution":{"observed_at":"2026-08-06T18:52:39.451379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02197","last_updated":"2025-06-11T13:11:12Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T04:22:55Z","title":"Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02197","snapshot_observed_at":"2026-08-06T18:52:38.799899Z","title":"Zhang, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.799899Z"},"links":{"cited_paper":"/paper/2410.02197","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:ecd0c59ee6984ed4ce795d046a5a5789277395e54f2a8842ec43382883cc1b6b","observation_id":"87ebc61f-baca-466e-855a-47b090309761","resolution":{"observed_at":"2026-08-06T18:52:38.799899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.432339Z","title":null,"venue":null,"work_id":"3af1b33b-6132-4f66-9524-428b3d92ee2a","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.804815Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:c41852495d206c1e9ecaedad171286cb79426ec3ff404e7f8e6e0b5bad0e88b1","observation_id":"57dd9b03-2a44-46d3-b077-a2ffcc84e3d3","resolution":{"observed_at":"2026-08-06T18:52:39.436613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-06T18:52:38.808890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.808890Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:87cae93730f4c063596fd6e509635f2e17e4cbf5fd20c44130ac7c6c98a9bfd5","observation_id":"6b833df4-92a0-4977-88b7-29c850e08e7f","resolution":{"observed_at":"2026-08-06T18:52:38.808890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.417086Z","title":null,"venue":null,"work_id":"f5e130d6-8bf4-4375-b7e5-f7ab5b4605a4","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.813440Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:93885767d992bca386fbdc1838eb3defc2023ef868cd3622febdddd88f44fbcd","observation_id":"0e55d8d0-b384-45ba-917f-38e4578e5718","resolution":{"observed_at":"2026-08-06T18:52:39.421914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.817370Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.817370Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:b871cc150735a77b7f911f9a467a98a84f604c81e02128e4f0b7e3f3dee4e822","observation_id":"c8c75fc2-f3d9-4982-935b-29a743119ac3","resolution":{"observed_at":"2026-08-06T18:52:38.817370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.822165Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.822165Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:cf745325e184f86e01d75468d7b464502802b2921adf6a5da14f9e498410ac4e","observation_id":"acb13461-2315-4188-8636-15f03c2cd226","resolution":{"observed_at":"2026-08-06T18:52:38.822165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.826438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.826438Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:01314ff44310c80d819ea34f15eb9fe5b2958db1cf1bebb1c91c1e86efaa942d","observation_id":"df42e405-82d6-4b7c-92ba-e6aeddbf3765","resolution":{"observed_at":"2026-08-06T18:52:38.826438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T18:28:35.982595Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2507.07855."}