Pith. sign in

Paper Citation Record · LEDGER

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment

As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2506.12725.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.12725 v1

Coverage vector

measured 36 of 36 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:52:40.142142Z

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-14T10:33:54.851493Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T10:48:02.077289Z

Reference resolution

36 of 36 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation eea05dbb-9d5e-4c5d-96c5-eeda1ea10ebb · outbound

This paper cites Nemotron-4 340B Technical Report.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Nemotron-4 340B Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:36.504800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:36.504800Z digest=sha256:0a6f8cd4ff34bf89f9b55e08f43c9df1f8ea6ce9c5f8f446d4630c9232247319

Observation be3c1356-7b0c-41fe-b551-d2a62c7d1b27 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:36.583198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:36.583198Z digest=sha256:4eb9c524d23f5965ac52e1c07dc7f4da281ee8dc088979bd6e9b9e1df9a8c551

Observation e8416cc5-e960-429e-a412-41d57b747108 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:36.684782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:36.684782Z digest=sha256:a41199019561ebededc39cc10fba178a9cbf699cd0987fdc2871e23b4e083a2d

Observation fecc0cc1-0998-40c1-9b0a-4ca3c7c5e8cf · outbound

This paper cites Preference Learning Algorithms Do Not Learn Preference Rankings.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Preference Learning Algorithms Do Not Learn Preference Rankings

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:36.777313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:36.777313Z digest=sha256:74d9a831bbf38609150d5f549303952c059cf7dbe80b8c1d1df0eaff04080344

Observation 584d3c2f-5e80-4a77-a6f5-9f8fc7961a0c · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:36.897991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:36.897991Z digest=sha256:ded7a55aacca038b3f1b8cf8108c42d496b4ad29747c28cc31774589f9c2d3ee

Observation 7e280702-b685-4bb0-9a7d-b0c727e6140d · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Training Verifiers to Solve Math Word Problems

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:37.016549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:37.016549Z digest=sha256:85bbc5c04bb35d342e0e02db672e2bac23766a5496e85c6f2acb24700b2353ff

Observation e321a7a6-f36a-4d5d-b7c3-319fd6a1159b · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:41.861680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:37.102719Z digest=sha256:3ccb7b8fef901ccec76e25030b8183d990e40cc25ae3f2571c3f1922fcb46a4f

Observation 2626964b-c71b-4c81-8e7b-ebe65b5487c9 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:37.207357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:37.207357Z digest=sha256:1fa02edf6114b276d41518a230d14d5fef952224f6f7861743d86cd40fc7c815

Observation 6758a168-2c5d-403b-b989-2374ebf5ca1c · outbound

This paper cites The Llama 3 Herd of Models.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment The Llama 3 Herd of Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:37.397258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:37.397258Z digest=sha256:5fc2bb6e254cb527604e1cdf4b5ab9e5e340184f6c968781e811f25886a4a638

Observation 69614674-8c3e-4a0c-b2a7-2212109711c7 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:41.832367Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:37.528114Z digest=sha256:0878cb314e6bf302924a2441e847e67f600951be1b666a65f6355f3f4f93c42f

Observation c7658ce2-70e4-45a3-9b4b-da6d6aeb9b54 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:37.786943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:37.786943Z digest=sha256:f925bc78a3b767572d548bee303e808d1f97b80653286056fba687fcb5a22130

Observation b6e5fefe-5cb4-4e2a-927e-7b4fce63c90e · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:37.953089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:37.953089Z digest=sha256:fce3060996d24302397d2d6a53751b7691d941e11efa5c97a8cac46c49a5a220

Observation dec2d96c-b540-40d5-b2fd-6ac2c13d463b · outbound

This paper cites Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.089108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.089108Z digest=sha256:886282e4d140cf3a931be50874a65c7bbb66ff4e4025eaacf7e7428c4ed10ae9

Observation ae148c67-3aee-4709-bed9-cfe1c368eacc · outbound

This paper cites Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.224309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.224309Z digest=sha256:13a85f1eb2160e4a7bfcef7459532d618453f54b6b5d783cc33604af0afad773

Observation 636ebf8b-c0cc-465f-8c3f-320acc1071a4 · outbound

This paper cites Decoupled Weight Decay Regularization.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Decoupled Weight Decay Regularization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.366472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.366472Z digest=sha256:87264d3bc51368dc52fa76f1ce7b4ea02aac64db1ebf3e8badc4ddb0a68f494e

Observation 52dc2c5a-4574-4702-97f6-6ae8a112963a · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.506533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.506533Z digest=sha256:f20e19650717ce660a1778fc398a1ec1eb3a7f41cac91117f7ba9888eb92be56

Observation 1bca4ddf-b767-4fef-97ee-50634f531fc3 · outbound

This paper cites Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.611434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.611434Z digest=sha256:732aa21c943fafb23f0fa0048823a6be4b6d8195867abd32b726a759c71665c7

Observation 1c8bc8ab-dfff-4b38-b740-7d91927a1c8d · outbound

This paper cites Iterative Reasoning Preference Optimization.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Iterative Reasoning Preference Optimization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.682978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.682978Z digest=sha256:027e9bd155c693ff99a9bf72219a8e42f6a9a9a46bcc321ed14bbd30ccb1d480

Observation 0a63c277-c376-4034-8a15-bf4045abdc64 · outbound

This paper cites From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.754574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.754574Z digest=sha256:9efe8c6d327c540ee320e6ef7c6c4aee3cd69a4a4c242345e297a39814728ce7

Observation 516444c0-147a-4c9c-94d0-d65198c0f411 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:41.665312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:38.829348Z digest=sha256:6624ffa811862a968e74d143699b14efb81d7abb9e5695e5165088906a5e0fb7

Observation f10f0bf1-7302-4892-b3a1-08e07374f506 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.904176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.904176Z digest=sha256:1f76a34da1a30730fbffcf5b0ee298d3b4c98563ad16820bab0c7e68ff03bf53

Observation ebf9e83c-244e-42e8-87d9-acd9d69a2cdb · outbound

This paper cites Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:38.975908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:38.975908Z digest=sha256:c8b156f6f80470a1d3087b7613d75129d9cbcb8e80a2a5dc0a8983e0b28583aa

Observation 7dc98299-d56f-4f05-a29f-e51e7514e890 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.043292Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.043292Z digest=sha256:ad32e098625067a07dd2834b260a93f950a04db407433e7c37a063ca809e49f0

Observation 89a706e6-a3cf-4515-9476-3c59ddedfcdf · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:41.472975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:39.129896Z digest=sha256:3892f49645366496457f9c271f08b7900020db5145ca0760b88ecebe25f16cfc

Observation ba407102-3452-4fc6-a313-f1dc0ebbda04 · outbound

This paper cites Understanding the performance gap between online and offline alignment algorithms.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Understanding the performance gap between online and offline alignment algorithms

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.184131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.184131Z digest=sha256:fce73f239a767cbb3589d914fb92c501cc50cee88119631481a6ea531941d986

Observation 23e75e75-04d2-441f-87b8-ad46b8f76dcb · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.270943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.270943Z digest=sha256:25e288c8328ddf02d9e64aa32b05e43f81b4a05433bd14c11d90e80891c4bc0c

Observation 7cc21a04-c493-4bc8-b9c2-a7f276b5e96f · outbound

This paper cites Self-Play Preference Optimization for Language Model Alignment.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Self-Play Preference Optimization for Language Model Alignment

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.353170Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.353170Z digest=sha256:b7fe1da2bd9a516a0fe71f0caab4e084b691fc121387980e1b961632f8eba1c6

Observation e31260c0-e133-4221-9f08-b385be1d2d8f · outbound

This paper cites Minor DPO reject penalty to increase training robustness.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Minor DPO reject penalty to increase training robustness

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:52:40.355270Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:39.447013Z digest=sha256:94019790350fa3dc427ba5bc865d610c477efd33587d13ccca6147a074d8615c

Observation dd7e1b4f-6f3d-4a44-b87c-15b8f9510814 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:41.126372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:39.530754Z digest=sha256:a086d9ec46d216e9b65bcd0cc758dec384c1ce3678b724dd058defb6dbda7615

Observation b041ab72-18b7-4dc3-9737-9372bbad9760 · outbound

This paper cites Qwen2.5 Technical Report.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Qwen2.5 Technical Report

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.621098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.621098Z digest=sha256:812464db41b378107a1f9a4077adbf5705164c7466599878d832d9cea32669f1

Observation 1df16d6b-e59a-4f7a-a205-005bb957c8f0 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:40.912826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:39.681987Z digest=sha256:37d2c770ec026506df89b25191095d7ac4029d9eba79ee86c1bda20bb2c7fd22

Observation 03dd5b3f-78d5-44f9-a972-9f66493b4e59 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.749756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.749756Z digest=sha256:a1317e9a3d85de90d18f9ae45621a22998e8451f012e108d78d0df2f64023628

Observation 42593b94-453a-41e9-a4c5-655ca96d3b21 · outbound

This paper cites an unresolved cited work.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:52:40.726777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T00:52:39.889533Z digest=sha256:3b9b969e53a64d9749488acad267b69f60967a4986912b94e245bf9e622e8336

Observation b94d2f5b-1367-4867-abf6-632dd9e7d655 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment Instruction-Following Evaluation for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:39.972011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:39.972011Z digest=sha256:72bcacfbe31be42d42a260079d5cc8e182fe7c788d40340d54d2b46b9f27bd2a

Observation 3d3f3190-89d9-46ad-b0ad-c35eeb0ee1ef · outbound

This paper cites online" 'onlinestring :=.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment online" 'onlinestring :=

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:40.073887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:40.073887Z digest=sha256:b561428e43c303bc4e3c13bc7af232f384a4551f57b119cb53732542414e1bc8

Observation 63bc41f5-9f7f-4a0d-8fbd-12c65e1f724e · outbound

This paper cites write newline.

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment write newline

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T00:52:40.142142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:52:40.142142Z digest=sha256:b0e25bb9746eef43e0fbf530bf7def07e030cc1ef3625a6b04d77544d0f32f84

Pith citing papers

Observation b6c688fd-1aff-47c1-9b42-4fce800708bd · inbound

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs cites this paper.

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs Rethinking DPO: The Role of Rejected Responses in Preference Misalignment

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-07-03T10:48:02.079020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-27T09:52:20.508013Z digest=sha256:a38f4ee827a9e747c7195aaefe70a8394fe23244541c1253870bce7c6aee6d95

Observation 1b629639-8ed1-4636-8dfb-7d7e727e1127 · inbound

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories cites this paper.

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories Rethinking DPO: The Role of Rejected Responses in Preference Misalignment

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-14T10:33:54.851493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T10:33:54.851493Z digest=sha256:4f87405b2623b742ac01ce8e3b1ca3f9d736de9dc6df7bf9043be7912e984a40