Pith. sign in

Paper Citation Record · LEDGER

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning

As of 11 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2501.15109.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.15109 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:39:22.659889Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4cb1b3ab-7199-469d-8200-1ade5491316f · outbound

This paper cites Enhancing Chat Language Models by Scaling High-quality Instructional Conversations.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.570129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.570129Z digest=sha256:cfbb487ec20d56c03aa2a16b5353b0eeb34af895ac60f5037c958029e2aadaff

Observation e204ea03-bab1-452c-9ab4-91cbacbf35f0 · outbound

This paper cites The Llama 3 Herd of Models.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning The Llama 3 Herd of Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.575009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.575009Z digest=sha256:8714bb3be954dcded76ba8470e5e389e475f0192e4a60145b0240b748748730b

Observation 12b3a973-da04-4eee-9de3-ba597e5fcc34 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning KTO: Model Alignment as Prospect Theoretic Optimization

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.580488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.580488Z digest=sha256:c81c9a58906ba770d30b8a43301e0b68bdb26871c20dd57235fa1264a9909abd

Observation 778039a5-bf25-4cb2-a026-57d5f990d648 · outbound

This paper cites Impact of Preference Noise on the Alignment Performance of Generative Language Models.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Impact of Preference Noise on the Alignment Performance of Generative Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.585488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.585488Z digest=sha256:ac67226b5d87f7ff70bd83446fa7f961048d9d9c54a53c499687065a5e5b53cf

Observation 96893a3d-cb9f-4d0f-8f3b-37b860da39a1 · outbound

This paper cites Towards Comprehensive Preference Data Collection for Reward Modeling.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Towards Comprehensive Preference Data Collection for Reward Modeling

Reference 7

Resolution
metadata mismatch
local_arxiv, observed 2026-08-10T14:39:22.888258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T14:39:22.591220Z digest=sha256:f75a16f0fa7f22a0688a9531dfdf73f76161350bfd112d3ac213718184048348

Observation eb394745-d226-4486-8f3d-34dce92d2ff2 · outbound

This paper cites In Proceedings of the 2023 Conference on Em- pirical Methods in Natural Language Processing , 9187–.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning In Proceedings of the 2023 Conference on Em- pirical Methods in Natural Language Processing , 9187–

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:39:22.988101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T14:39:22.596666Z digest=sha256:a687cab70c416271fb42ae8a99077036864723984985500d433d2da5fb4be561

Observation 6374e27e-381f-473f-b62b-d321476f14b0 · outbound

This paper cites One-Shot Safety Alignment for Large Language Models via Optimal Dualization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning One-Shot Safety Alignment for Large Language Models via Optimal Dualization

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.601279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.601279Z digest=sha256:ee5847e3f5acab5f1b246f640e83bf98d071dc9fc57440072f487749df29b8b0

Observation bd44d406-4f46-49e3-be8d-c303673f55ad · outbound

This paper cites Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.605842Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.605842Z digest=sha256:24263bad2473509604d462971c42c52ad66b522987182a374b2c84be31aa8f59

Observation d9f28792-0da2-4476-8710-094a050b3e65 · outbound

This paper cites Mistral 7B.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Mistral 7B

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.610940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.610940Z digest=sha256:e04853abfc8b212dda1210ee8eccb7a15faf74c35978b9fffaa3baaa2233f545

Observation 5348c521-0ea4-4238-b262-f561f98c6ff4 · outbound

This paper cites A Survey on Human Preference Learning for Large Language Models.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning A Survey on Human Preference Learning for Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.615302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.615302Z digest=sha256:2a711e308367f7393e2d20a54c5ebc63b5e8a37b0db98c5b5c03c5542b6b0153

Observation 5a792d65-1c92-4d01-9816-18e06630e5f7 · outbound

This paper cites Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.620676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.620676Z digest=sha256:60185f06dbdf6c921e9f222d58d7920abfdac0c3c5a0203a087f52123fea7549

Observation 624eec9c-f1d9-41f5-b2a7-b2eedc21ec2d · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.625907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.625907Z digest=sha256:cf62902f07f4fc641f51db4dc38043762201269ae12cbdcdaa0bfbca5852e033

Observation 3d3bb5d8-2270-436a-ab72-33a6e358a940 · outbound

This paper cites Statistical Rejection Sampling Improves Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Statistical Rejection Sampling Improves Preference Optimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.630705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.630705Z digest=sha256:a786adc684da9ef286549f8e97e1b5be29d6e5c8c6a88851a5b5f2a7d9509a81

Observation df0fb837-b648-4b15-9f59-646e4f21287a · outbound

This paper cites Enhancing LLM Safety via Constrained Direct Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Enhancing LLM Safety via Constrained Direct Preference Optimization

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.636132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.636132Z digest=sha256:f76382ad5a64857002eac4d83247897cd14a1d95ce94ed4f282af8d8be985eb4

Observation 8b442214-fe35-4712-80ef-f6a06e762b45 · outbound

This paper cites Adapting Large Language Models for Content Moderation: Pitfalls in Data Engineering and Supervised Fine-tuning.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Adapting Large Language Models for Content Moderation: Pitfalls in Data Engineering and Supervised Fine-tuning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.640623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.640623Z digest=sha256:0b1e57ddcd0f23c7155404fbff154af76b0c4949dd4a8871c49a2a89559bd130

Observation d7dacf60-509c-4f74-a326-58e84b29d054 · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.645558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.645558Z digest=sha256:cd6e2fd6a0adc8b7055a2b019fb2ef06eab807dafa3757c00daf7d743c15d5e2

Observation c152b506-7f2b-42cf-8134-ac543e973363 · outbound

This paper cites Filtered Direct Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Filtered Direct Preference Optimization

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.650320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.650320Z digest=sha256:9a1e9742812bda13c07ac1aff70904f54d857fa21cd758563a4e358d44d96970

Observation d5707e30-3e9c-4230-8576-05f25e428de8 · outbound

This paper cites Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.654858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.654858Z digest=sha256:d0df3ae7517314bb265c2858a02b239c19ca1a36f083efbbfb0ba523dda23f38

Observation a60a2d6f-201c-476f-8f32-95acc3e726bd · outbound

This paper cites AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.659889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.659889Z digest=sha256:14d20b25b586272b7af33ba51e29935f6c06020d2baca01d6c247d0e34845155

Observation d0c11f7f-e6a5-45f9-af30-f6f10cd69af9 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.565369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.565369Z digest=sha256:a30f892ce4656200b73b2642ac1ce12c405364f8293d665398e61239b838211d

Observation 86a11f2f-4317-4f7d-8b69-1c7f9e50bc3c · outbound

This paper cites Provably Robust DPO: Aligning Language Models with Noisy Feedback.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Provably Robust DPO: Aligning Language Models with Noisy Feedback

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.559926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.559926Z digest=sha256:f340dac645b4ac04135fd03719b9c35c30d457664a087af7a891f4871dac8165

Pith citing papers

No inbound Pith citation observations are available.