Pith. sign in

Paper Citation Record · LEDGER

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment

As of 19 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2505.12435.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.12435 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:40:51.092593Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

66 of 66 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved65
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3daead4f-b2b8-4a69-986a-f40a5f44846a · outbound

This paper cites online" 'onlinestring :=.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.787555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.787555Z digest=sha256:1f302a9a765461502a3fed3adffeafcac633749a4f4f2dfba6c36bec5de3a838

Observation 471db8dc-dc7a-4efc-ae10-251227468576 · outbound

This paper cites write newline.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.792034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.792034Z digest=sha256:2956517ea3005967d525209cf8bb4f43ac9622a9617803db940041052f518e69

Observation 242e1644-c186-499d-8257-06c3c33462bc · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.798147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.798147Z digest=sha256:cd02f25e5615175037e11b35b2ebc8d440060e4e5e1b4cb1d3bac10f7cf45b18

Observation eb030c38-f58d-4ec7-acc3-9d46281e1ff9 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.802374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.802374Z digest=sha256:36ce1d30fca04bbf5ee2cc110fda97d8f3b6c5a00856b64109f93b9f944302ef

Observation 15c011cf-db3a-4cb5-be37-336a26bf220c · outbound

This paper cites A General Theoretical Paradigm to Understand Learning from Human Preferences.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment A General Theoretical Paradigm to Understand Learning from Human Preferences

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.806492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.806492Z digest=sha256:0250ee4b94c33dc72f0ff119b1f3c569317207b9aaf264ddae4cce094c4f9392

Observation 4f1163fb-4054-4734-b9d2-c770d6a7843f · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.810310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.810310Z digest=sha256:0890114ae34de1a1dca7683ffe28a836b33e536ad1cc071e9185af7cc4fb8237

Observation cb26f0d1-c64b-4224-a5c6-a1293c47d654 · outbound

This paper cites DeepSeek LLM: Scaling Open-Source Language Models with Longtermism.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment DeepSeek LLM: Scaling Open-Source Language Models with Longtermism

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.814418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.814418Z digest=sha256:84898697570dd12703f4bf8112a603d9326be69b2e09b329b3d350bc1063fe7a

Observation 50cb692c-a232-41fa-ab4e-baea64a1708d · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.202520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.818145Z digest=sha256:d77066ecb93b4de85965d1b138fe06aaef9f18ace0f02bf9af5e7e53636126ca

Observation e7c1db1a-76ad-4499-b186-915f89c90781 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.188957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.821666Z digest=sha256:99baf7c2b2ebbfe558dd076fad5eea26f02e89d2022c5116e370e0aac244f852

Observation 6dcde4ba-4f9d-4f36-bff6-14f2ee10ce64 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.169980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.825083Z digest=sha256:b7466a29eac24d5c0a4e2d502eaef96ffcdd9547231fc87c47d0d68a2d99a03e

Observation 8c1eb1aa-7c0f-4795-9129-1c93642ab4f3 · outbound

This paper cites Sheng, Huaiyu Dai, and Dejing Dou.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Sheng, Huaiyu Dai, and Dejing Dou

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:40:52.154030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.828658Z digest=sha256:59f8463f332f864552d7709ec07e2225473735585fa3fc96467bbb2757aab1bd

Observation 5bce26c4-f3eb-4eab-9a1f-d769ef985db7 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.140887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.832240Z digest=sha256:50159d475a044af8335f96a0c8aad832d7e3feb8d425c890be294a80a9eeb612

Observation 116b5ec6-b7b1-4a06-a2f3-92de6de188de · outbound

This paper cites Noise Contrastive Alignment of Language Models with Explicit Rewards.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Noise Contrastive Alignment of Language Models with Explicit Rewards

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.836712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.836712Z digest=sha256:14c294b2bb9a2da734556114bab2e7dd9782c5b26f29b6733d04afca07962d2f

Observation 94b237cb-c520-4d8e-ac12-01df6f1c74ad · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.840423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.840423Z digest=sha256:1502c87596dd5dacbb35535b9f97c25024aa9d3dc415c97f90ca66d3212ca07a

Observation a6d4f618-b656-4312-beb0-5df380dd9ed3 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Training Verifiers to Solve Math Word Problems

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.844143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.844143Z digest=sha256:df25afe4e2491fb4810ffb1b2a5a762dff53ab67790983c7f99d3abd1cf22646

Observation 59f474a5-f2d2-46a8-afa8-4ca17752d813 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.847988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.847988Z digest=sha256:c2596e7f8fff0ce4bcf238712691a071872524f8a57c7fd0ce39af5dd62382c6

Observation f473829f-c119-4b41-816d-8ea4ab4ef353 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.852840Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.852840Z digest=sha256:2ceac99359b088869b28ed184fb93ff80414c3671efd99b467678c0866851f3a

Observation 2c946d99-1fd2-4baa-a825-94d7a8028475 · outbound

This paper cites Enhancing Chat Language Models by Scaling High-quality Instructional Conversations.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.856604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.856604Z digest=sha256:083a3e17132511d0dba90f4d0e0df5fbf4bbad7c572193ccc37ababe4de49cab

Observation ecb7e8e0-9952-40de-985d-ba8bbeacb3b9 · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.861519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.861519Z digest=sha256:7f1166768552a9896724d89a3020d01f578ed551bfdab93c9577f52cf86ee04d

Observation def4e0e7-5314-4c03-98aa-0e9226a715c1 · outbound

This paper cites AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.867012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.867012Z digest=sha256:ed1b6a7e3d54d39b5dcd664af247d3e5522418055fc9787660e17f8fae39f21b

Observation 63efa318-3e9b-4326-8878-ef7c58462398 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.126768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.873915Z digest=sha256:4f1e603f3670d741e81c7effa43dece3990b779ddf52f9516a6ab53dd1cb40a3

Observation dc60c685-346b-4bfd-84ad-f9d20e27992f · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment KTO: Model Alignment as Prospect Theoretic Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.878800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.878800Z digest=sha256:0391a04464d5d25c91d3d7f67e75cbfea4a2b3bec5efefcf63516c6bb6b10f6c

Observation 7a277e6e-d56e-45de-8967-eb401de4836a · outbound

This paper cites Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.883420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.883420Z digest=sha256:e97a60483aeb71482d4c8083a7fd54fb80f98b8d193777f0238cf4f6930f1d9c

Observation 33fdbbea-461d-46bb-a380-38e669142bb2 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.107987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.888201Z digest=sha256:e6001e000dd403c0ed6c616d9582d5baebf1e22355edf8f2797a6f361a17193c

Observation f4dfa443-3d81-45fb-9ef8-cdc03312dd05 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.092389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.892378Z digest=sha256:166cf3dd972b741510eaebbf4b6a4a7bcff485cbf847668c7a69f2d658bf26f9

Observation 63839f5a-2dcf-4b47-84ee-314c01a29507 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Measuring Massive Multitask Language Understanding

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.898674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.898674Z digest=sha256:04378f823adc583cce0833b7fc35180e1180223be2974bb383d7a54723bff827

Observation bbb0a843-c63b-4c3f-872b-a31894efb4ca · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.064819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.903456Z digest=sha256:b1eb71c752b6be8a8b8af9b85b010242e3aa7831c386ef1d7a3d14f4126d69cc

Observation e737e666-7a83-4300-9e3b-36e2ea3d1156 · outbound

This paper cites ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.907728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.907728Z digest=sha256:9d29ccb0456b6f689748457d3fa52604aa5f161e041d41b3cf81bb44faaf9589

Observation 64091380-0c4d-499a-88c7-2cc65c665442 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.048184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.913755Z digest=sha256:df6c862620caa0819eebd0673d1a537e39836db31d8ae8408cbafaf366ac8a93

Observation 3d22dd6d-a93d-4c10-8afa-804870a03e2d · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.034963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.917328Z digest=sha256:a6d59b8ba9e9abad6f19ea5be4351e96f5f6459b778f0155c2290d0d829696a1

Observation 47a23641-f57b-43d9-9f82-e236fe6762c5 · outbound

This paper cites Binary Classifier Optimization for Large Language Model Alignment.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Binary Classifier Optimization for Large Language Model Alignment

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.925689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.925689Z digest=sha256:a7c1a75a96bb2027989c6e5a7d152d9b7b1182dc8034a2582950276030dfc465

Observation 86856a6b-6237-4af2-9633-b6e380071d78 · outbound

This paper cites Hashimoto.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Hashimoto

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.930298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.930298Z digest=sha256:e0ac6842cecd5b72e05e4f421ae50dad5c60ed6ba2d866d81ed4d999f8378c0e

Observation 6aa1d5a6-01f1-4674-ade9-824e5f66bcac · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.934357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.934357Z digest=sha256:bbe6da81592d6226cbe880d42c939081adda9c1c41c065c5da393381a738885d

Observation fb60a56a-9752-4689-b4d8-4aafc65577d5 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.997053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.938542Z digest=sha256:e41c42cf25ac8f05fbe5d55868899461507279ab81cf2178f6b6898bdc6af6fb

Observation def9d6f1-f470-4624-9326-390d6ca74ff0 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.977717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.942801Z digest=sha256:3d6ee65479a52a030c577fc5800da52a3077dd1206540e0f2515900deb3bc27c

Observation 09bb4ae4-c9ce-4606-b18d-37193864672d · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 37

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.962086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.946587Z digest=sha256:f552aa37b1e8f8853bd3eca68fd6fc2775c43059f9cc9489728fb9e2898a0db5

Observation 1e676ca6-5bdd-43f4-8a58-c7692a3e7ea6 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.947236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.950791Z digest=sha256:e000a955314947c4edf126310a654bb24acc113117d47e6ff101efc4983469af

Observation c00ec4d0-b2ef-47a8-89a7-c607f7bf04b7 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.932469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.954528Z digest=sha256:e22dd630b9283e475d877a5ddc9d852d46c517b421f9a97274167bd0f147f63f

Observation 0e12d145-60b5-4f3c-9dbe-a0d5970f7689 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.918412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.958054Z digest=sha256:684d891af0468250e4540bc9dcd3ab512347e1c04955da05d73bfa76b3569a9e

Observation 84318b56-4c45-4301-9e8b-d638dcc0259f · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.897471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.962897Z digest=sha256:cfecda39e1ce325bb17691dc2c97fde44ae9006f893e3555bf768141f2ae4d5b

Observation 77eb1868-571e-4e4b-af4a-1eff649fad8c · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.882737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.966934Z digest=sha256:afce0369f34d8ac45a395222d73cf6b43ab7a1af2cf912e144d4e02e982164d0

Observation 965d54b0-6259-4bf6-8fca-4ef0fe17f6b9 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.864918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.972276Z digest=sha256:6846e3f3b4c2ac90417643cbfe4e243d2e11e355d16d666499218deb3636857d

Observation 942fabb0-3d12-44be-a1cb-3daa306aa7d5 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.851855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.977632Z digest=sha256:93353b1a452125026a7b095555d1068c75f1154c87e056071af933a60dfc53a4

Observation 74d4375e-5068-4b24-91ed-3e739cd9342e · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.982935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.982935Z digest=sha256:68718e26125be4dab38cb545f80df8969d6e280a6345eb5ecc29bf1b3c64cc04

Observation 5e656f0a-fbf1-482a-b962-e892415a274b · outbound

This paper cites Length Desensitization in Direct Preference Optimization.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Length Desensitization in Direct Preference Optimization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.986937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.986937Z digest=sha256:effa02a99a77815ca0434b8f717eeea70eb79c22afd7e7e5ea369372b655c27c

Observation 1b480cfa-c648-4d8d-bf96-ab522ba28b53 · outbound

This paper cites Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.995488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.995488Z digest=sha256:80bc1dddd5e45e9ce0b7b507a9ae9c3376a06fd5cc2d24fc34f5f9cacfe78947

Observation 12f518c5-463d-403e-a1ca-bd2d435be68f · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.834403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.000659Z digest=sha256:f382e221f1b3e0e8a99d624f0885e5ccc7fa55d9f7717428f02e50e01bb6dd70

Observation 92a9f314-f8e1-4876-961a-abe8abd24226 · outbound

This paper cites GPT-4 Technical Report.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment GPT-4 Technical Report

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.008119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.008119Z digest=sha256:510d5c75503224b5d2514b7af7176425f131d6183b45f6685ffd59a7a27e9c7c

Observation cb16990e-0a17-481b-b1cd-b241535b1e41 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.013546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.013546Z digest=sha256:4695d7f83de53a027aa6c85e89770ff939bbf57c16328f18ec54c9badfeb6eda

Observation e8b78292-e152-469a-a2af-8456842ab2a8 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.809529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.017748Z digest=sha256:4cd64f3c4d5dc02173de0f233f079b229ede08f663dfff494a2bd69e2ea9510f

Observation 49278843-dc57-447c-b1d9-14c11ea65aaf · outbound

This paper cites Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.022359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.022359Z digest=sha256:b05b4a65cbcbc65e3e0dd1e80227a76d620ffc6684bbd61355bbedfdd6afc87c

Observation 99f2fd35-6031-488c-b7f2-e0848ffc7eb8 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.782314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.026456Z digest=sha256:9996ec4eb5c161dd6a72f58cbc56852c7b2865a175c8dccce71bbbe006e2f267

Observation fdea8842-4847-4848-91b0-f0a4ad7b24d0 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.029963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.029963Z digest=sha256:3eafcec4b5b390a1210a9260bbd71eb91146babc6ec3b3c6582408c24f202755

Observation 8228630f-c1b9-4908-956a-89e889d6f0b3 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.755221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.033632Z digest=sha256:0281080e33a6a6a902b91798ff1a47329a53ee7ff9c17b0bd37f7d5f7c8ea4e9

Observation 836d6584-7f24-43b1-8f1d-123a3089bf19 · outbound

This paper cites Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.037648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.037648Z digest=sha256:0015f06465e4b5c835b44ea02e7a30c1e994dba836ed81cda824c646cc5442a1

Observation 2d82d505-afad-4a68-8a06-0e1a47508402 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.734070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.041091Z digest=sha256:c5c0df8347af446a3431c86e4f4b588087d0e7143c33aedd2656309ecb93bd97

Observation e944a157-1092-4098-a144-fa2293b4a557 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.713537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.044923Z digest=sha256:0e150988d670d8ff9c45d86d72259a1d62774e811e917146778a6f15d9b6bce4

Observation a2e21f24-4ebe-4d3d-aea4-1331488718ff · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.692838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.048927Z digest=sha256:38de00039b5b2c4bb120b54715f50ba5a8d83fd452dd96f828d091fc4618ca15

Observation 4f1a5d66-53c4-4c68-9a19-fcee577037de · outbound

This paper cites Qwen2 Technical Report.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Qwen2 Technical Report

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.052531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.052531Z digest=sha256:b884051108631fecad236d59cba4f41124c485267ddb0f6cdb279ed39babd3b7

Observation 113a36c2-1c1d-4bd1-90a2-8ee91dc66bb3 · outbound

This paper cites Token-level Direct Preference Optimization.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Token-level Direct Preference Optimization

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.057004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.057004Z digest=sha256:156c223dc28067f0d48c7dcf641d490aefbadd0ab2fb99829d1ef5d7aba1b95e

Observation 1520b3a5-d711-4471-96b0-0b2f6239d878 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.676137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.062418Z digest=sha256:d7c957e9c285e2e5d69e873f56702bb6775bc094283cf3ebe4f180e15c84d800

Observation a8cf8d9a-a90e-4cf7-b737-4486a5049f24 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.068237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.068237Z digest=sha256:d1e5950d08e0e6772dc11e786e9b24bdc8aea4e09908b88bd643ae93663d93b7

Observation 0defa92a-6493-4a6c-9bc4-906b1bef0385 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.658062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.075518Z digest=sha256:1849edfcb53399943fab687d5aa7e7041d3e663dec3d92561516a82746cfea27

Observation aaa0e2fa-95a2-4fb0-ab33-4a89672a7043 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Instruction-Following Evaluation for Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.081237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.081237Z digest=sha256:2462651834a56cdb3eaab7bac8e9143c4c99c7e042842b1bdb1e454cc804115c

Observation 1affbfcb-9d5c-4c60-9272-42318ed6cca8 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 66

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.640471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.086789Z digest=sha256:29f4ca2b9881d49d9f7ba514c10dd0fda16f0e547950cd0b2f8489be79af0b1c

Observation 9f7743f8-2322-41ee-8229-9f1467dd42ad · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.619564Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.092593Z digest=sha256:400e74d6fa990de3e3d7761a61960bf42e741b1ea9fc58f0d45ae24360097141

Pith citing papers

No inbound Pith citation observations are available.