Pith. sign in

Paper Citation Record · LEDGER

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?

As of 9 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2505.17122.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.17122 v1

Coverage vector

measured 59 of 59 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:15:46.465735Z

measured 59 of 59 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

59 of 59 outbound references displayed

  • verified exact2
  • verified fuzzy21
  • unresolved35
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dba8227b-b72d-479f-bde8-1c13692362b6 · outbound

This paper cites Aligning Large Language Models with Human: A Survey.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Aligning Large Language Models with Human: A Survey

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.155225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.155225Z digest=sha256:ea993a53bc70139f900d1f149888ad3012d619ad8362bbbf00a286ccee67c4dd

Observation 7d2ed43c-03db-40a8-bb27-85e3106ca46d · outbound

This paper cites Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.159882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.159882Z digest=sha256:fd92cd6c7a1fda74c5132dac0db25da52e6ba911866cd7c8b58668ab62d374c1

Observation 8cd1976d-7b7e-4604-8e5c-92cb51178a8f · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.165537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.165537Z digest=sha256:cbda0ba354a888e317dfb82624e664d979340847a62b002ac2e596c3c1a5107f

Observation d28a6798-21be-4253-ae69-eba4f9d6140c · outbound

This paper cites A General Language Assistant as a Laboratory for Alignment.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? A General Language Assistant as a Laboratory for Alignment

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.171527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.171527Z digest=sha256:1b0cd6f6a8bacf237ac66b53cb14518485b7a7dc32b6ca53da90cfaa3741879f

Observation 88d0f485-409f-4db0-9ac5-9536f135504c · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.176534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.176534Z digest=sha256:d71499f6d0991ca9634f4330b46b8c70b76235f9de38df185cf3092542c8baf6

Observation cf6db343-9acf-4e71-8fe9-75b41c3e3b86 · outbound

This paper cites an unresolved cited work.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:15:47.074771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.182023Z digest=sha256:cf77c491dec69707eb6e146448021e9a056aa8c1568aa61e526f5925fa540c07

Observation 90b915a2-73f1-4b6a-b678-03d3275cabb1 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Manning, Stefano Ermon, and Chelsea Finn

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:47.064401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.186148Z digest=sha256:9850752d6e5e33faf633781b84e35e4efee16f01c9b1930ead1414a8f47b912e

Observation bdd6cb4c-e052-4261-b266-da5ac02872ac · outbound

This paper cites From Lists to Emojis: How Format Bias Affects Model Alignment.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? From Lists to Emojis: How Format Bias Affects Model Alignment

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.189911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.189911Z digest=sha256:6e0b27fd48ded6cc28efe0f6fe174512fb5392083275f07665c8a29ab69a7e5e

Observation 78f9a988-9b9a-4100-9941-4c68a102176d · outbound

This paper cites Offsetbias: Leveraging debiased data for tuning evaluators.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Offsetbias: Leveraging debiased data for tuning evaluators

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:47.054824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.194999Z digest=sha256:6db798772cf90c40d16fce39f1840f74f391d33c35eca9353f46bb5dc8bd7e51

Observation 0c05f996-aa3d-40b2-97b6-ba0cb90335e9 · outbound

This paper cites Disentangling length from quality in direct preference optimization.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Disentangling length from quality in direct preference optimization

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:47.043879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.198963Z digest=sha256:013784e7992b1faca55ac3c637156e5b24a27e172d6003ca2510efe8f80c86ff

Observation aaa623f8-5777-4bc0-9e76-25b3c7eaf379 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? KTO: Model Alignment as Prospect Theoretic Optimization

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.203797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.203797Z digest=sha256:3fdc069ef7124d53bccbef87bf34e56385c440856b28db53f60b1e344c57e31f

Observation 14be7723-3d69-4534-914b-b17772787e2b · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? RewardBench: Evaluating Reward Models for Language Modeling

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.208143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.208143Z digest=sha256:5742ad7b0fd565c1994b9e9a5040e0cca8c9616389a8ff67e160950ed3b58ae6

Observation 36fbaf91-6663-49fb-bc1a-4bf3cc467387 · outbound

This paper cites Predictive pipelined decoding: A compute-latency trade-off for exact LLM decoding.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Predictive pipelined decoding: A compute-latency trade-off for exact LLM decoding

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:47.026558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.213130Z digest=sha256:e8862cf7517a77b1505a105bdcb9267bd3e3b2ef1f8738bb810b53dc1df153ed

Observation 80188a3d-4398-4158-af0d-294f3c38082b · outbound

This paper cites Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.217676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.217676Z digest=sha256:20d528bbcb177a718479f096550e1aff0c69adddfb233b696758c50b4b2896d1

Observation 3b8f2045-d632-41d8-8738-8ebcedfca088 · outbound

This paper cites SAM Decoding: Speculative Decoding via Suffix Automaton.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? SAM Decoding: Speculative Decoding via Suffix Automaton

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.221364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.221364Z digest=sha256:76947c0a4ac6423ab48a05a49036c90b2cb900d23c6dd6588a2b85f853170c7e

Observation 42994f2b-78f4-42ef-a002-ba94498ea71e · outbound

This paper cites S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:15:46.667015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.226353Z digest=sha256:0f8827952d6e12f229ed144c4f01f4b4ee6868e931fa5fe5e58768627dbe89d8

Observation 29734963-f7b4-4944-8d9e-0e41c3a07c99 · outbound

This paper cites The unlocking spell on base llms: Rethinking alignment via in-context learning.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? The unlocking spell on base llms: Rethinking alignment via in-context learning

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:47.015026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.230848Z digest=sha256:b4ac26d14d750aec061fbd137e12f5cc4f5a98232b3b3b2f0e481f744226bf66

Observation 70a963a9-1809-427e-9e7d-f6048fc901e8 · outbound

This paper cites Safety Alignment Should Be Made More Than Just a Few Tokens Deep.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Safety Alignment Should Be Made More Than Just a Few Tokens Deep

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.235543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.235543Z digest=sha256:17be6164f11e0cd143c8a9cc5c07b4e78a1309c30524899596b60a8bb5c74f24

Observation b5578633-572c-42b3-8172-d6d7d4b49a57 · outbound

This paper cites Christiano, Jan Leike, Tom B.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Christiano, Jan Leike, Tom B

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.241872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.241872Z digest=sha256:6248d973b99e108bd728730547cb132204b283204c372046860a240c39efce1f

Observation 57406553-5096-4b3f-8ebd-d538567bbf03 · outbound

This paper cites GPT-4o System Card.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? GPT-4o System Card

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.247561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.247561Z digest=sha256:08a3f5bc556f38eec42fea5feab29b0d30136c1618988eb8d04ce225b1ecbf2a

Observation 8e0cc3c2-ba1f-4e04-b503-9cce0e585656 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Gemini: A Family of Highly Capable Multimodal Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.252669Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.252669Z digest=sha256:bd61105e34b8e5c34446a9be754def58ca8a22b61993d5c53b056c0a08d3bee9

Observation 51ed382d-c3ad-4485-a917-b07d40cdee5e · outbound

This paper cites The Llama 3 Herd of Models.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? The Llama 3 Herd of Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.267359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.267359Z digest=sha256:ea55724d3941b1f7ead9c0a0bf2c5f580d0584967d9273de424bb7cc5b5f27ee

Observation be6848b4-31e8-4f5b-8cb2-4ba3225c8f7c · outbound

This paper cites On the weaknesses of reinforcement learning for neural machine translation.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? On the weaknesses of reinforcement learning for neural machine translation

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.996196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.279057Z digest=sha256:cfdb8beac525a2512b53a4edf9ad012004a7f2804290ca211859495b4d9dbab7

Observation dc0ec6a0-0fe7-4e1f-8560-d83ff9f57534 · outbound

This paper cites Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.288418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.288418Z digest=sha256:979b0a938749dfab210e15ff14d522e182a2945bf5a995cb12f24b7c545d932c

Observation f2cf9eaa-5d02-454e-91db-cc41a6877c14 · outbound

This paper cites SLiC-HF: Sequence Likelihood Calibration with Human Feedback.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.299308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.299308Z digest=sha256:1c6df0e18e454aac57f9cbc642143cae3319ad6cb460d1dff33a02b4cee30dce

Observation c0afdf0d-fc39-4f31-92dc-09b17d5d8606 · outbound

This paper cites A general theoretical paradigm to understand learning from human preferences.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? A general theoretical paradigm to understand learning from human preferences

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.983769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.311422Z digest=sha256:ecd8011040e8b568a80fd039776c2fd19f6096b3466de59d61fbd3056a68707d

Observation 0fa5c61f-94c3-481a-8301-bcdcf867e642 · outbound

This paper cites Generalized preference optimization: A unified approach to offline alignment.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Generalized preference optimization: A unified approach to offline alignment

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.971851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.325992Z digest=sha256:df916e2239651e377b8ec7cc00ba703a87a69d9dca90cdeaed15592fd476d9b8

Observation cbfe94fd-9683-4d9b-802f-3a45d98322da · outbound

This paper cites TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.338984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.338984Z digest=sha256:2a6cbe1ed9cf6ab6d0683e5c33fb610d1d1c2dbfd2ed4f15224ee9a6be5f0018

Observation 096646df-cbfe-410b-b49b-a168e2289500 · outbound

This paper cites MaxMin-RLHF: Alignment with Diverse Human Preferences.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? MaxMin-RLHF: Alignment with Diverse Human Preferences

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.346809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.346809Z digest=sha256:c3958b8886a96f35b3c7b8d15503916b005cfd972d9c056ba475ceb342b5b120

Observation 5adc1e2e-aa18-4435-b8a5-63735f194c7e · outbound

This paper cites an unresolved cited work.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.352530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.352530Z digest=sha256:33d8f2385771b212c69025ca54b2d35d45e65b5774e565712d01ca1fe4cff5cf

Observation a4303cc5-e39a-460a-9445-18eeca19d7b1 · outbound

This paper cites Enabling Language Models to Implicitly Learn Self-Improvement.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Enabling Language Models to Implicitly Learn Self-Improvement

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.356346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.356346Z digest=sha256:7c4d1f5597905636a0c521b3064f8a62ee391b0130cd13fb61466a917c50496c

Observation e723c431-617a-4fe5-b356-22ad22a55e18 · outbound

This paper cites Mankowitz, Doina Precup, and Bilal Piot.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Mankowitz, Doina Precup, and Bilal Piot

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.955912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.361813Z digest=sha256:ff062bac5ab6279ca6eab40323fddb6f2ea0a892bdfbf3748fb1d0e35f664052

Observation 9c33439b-9166-4d30-a133-cedb8c35ee48 · outbound

This paper cites A minimaximalist approach to reinforcement learning from human feedback.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? A minimaximalist approach to reinforcement learning from human feedback

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.938379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.370672Z digest=sha256:4498a3a4cead39ff853c62d83a19248c0c88ab5c854e08ee6f404f9cc728f634

Observation 4a78435b-0abb-422c-95b9-2722526d7a4a · outbound

This paper cites Online Iterative Reinforcement Learning from Human Feedback with General Preference Model.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Online Iterative Reinforcement Learning from Human Feedback with General Preference Model

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.376259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.376259Z digest=sha256:6ba180508da753e90222eee5dc33bd05bb10c8fb4bfb27342a2ae62f1a595d27

Observation 5b1df7d4-fdc7-47fe-b973-4912033fa0a3 · outbound

This paper cites Llm-blender: Ensembling large language models with pairwise ranking and generative fusion.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Llm-blender: Ensembling large language models with pairwise ranking and generative fusion

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.928505Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.381354Z digest=sha256:201dbe159705fc9fff0ae536d43264c09acca2225fc37f423553438bbe709836

Observation a75a1773-5596-48cf-9023-c22a84bf438f · outbound

This paper cites Liu, and Jialu Liu.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Liu, and Jialu Liu

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.918214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.385221Z digest=sha256:9db0dd5f947109126852a439cf4fdb08ddc34e10c8f3fce6a2e4d8102e8c84e4

Observation f9c63e0b-c0fc-4171-ac2c-44ef9c55fbb5 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.395903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.395903Z digest=sha256:4ab5192a526759b341690348774f59f5c904e7e18814a2fa3cf66261bb09d152

Observation 8f425f02-a243-48fb-a7ec-28fd60e427b8 · outbound

This paper cites Helpsteer: Multi-attribute helpfulness dataset for steerlm.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Helpsteer: Multi-attribute helpfulness dataset for steerlm

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.908635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.400708Z digest=sha256:217efec2f36eddf12d4f67fcf5a49bcbe3c46c437b5b54200ec8ce05aba33add

Observation 3b914cc7-38cc-4cf4-b2d8-134cc42f01bd · outbound

This paper cites Interpretable preferences via multi- objective reward modeling and mixture-of-experts.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Interpretable preferences via multi- objective reward modeling and mixture-of-experts

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.898167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.404216Z digest=sha256:3219bd87748886f6d4e6a603164df4f1f422deaec96b9622cde94b8133ab6210

Observation 213384ad-82ee-49b3-a8c8-1caa91b66d9e · outbound

This paper cites WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.407046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.407046Z digest=sha256:ba1ad24a07ebf457533dd14f5c68f6807d98ac822a0a076798c97ec0d211a85d

Observation 28d70d3c-5a72-4fb9-9e3d-950c56eeb9cc · outbound

This paper cites Let’s verify step by step.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Let’s verify step by step

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.410419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.410419Z digest=sha256:638fd54f079582861f1015be9af2e7293a1fbc53f4e21707c054adbe352729a4

Observation 9e0e3dc3-97e1-4e1e-b2b4-f66c1636120f · outbound

This paper cites Process Reward Model with Q-Value Rankings.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Process Reward Model with Q-Value Rankings

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.413629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.413629Z digest=sha256:9ea03ed5df964b1371bbce1db5f1b60f905c72bf5c16a072a46e65ecc92591b8

Observation fd190bca-f36f-4e72-8ff7-572712098a4d · outbound

This paper cites Glore: When, where, and how to improve LLM reasoning via global and local refinements.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Glore: When, where, and how to improve LLM reasoning via global and local refinements

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.880460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.416756Z digest=sha256:8e4a5d6f0cabe263597e974ccc03fe0fa6c527bb83daccf0075ca61cf8030be5

Observation 03ae14d6-fb94-4686-9f1a-5dde4f332355 · outbound

This paper cites Defining and Characterizing Reward Hacking.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Defining and Characterizing Reward Hacking

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.420808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.420808Z digest=sha256:d11fc53180930fd610e110dd54876fa271e8e981ce7ba2a3a73f7d229600a7cf

Observation 5d438329-22eb-47fd-abbe-59d554aa8208 · outbound

This paper cites Arjona-Medina, Michael Gillhofer, Michael Widrich, Thomas Unterthiner, Johannes Brandstetter, and Sepp Hochreiter.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Arjona-Medina, Michael Gillhofer, Michael Widrich, Thomas Unterthiner, Johannes Brandstetter, and Sepp Hochreiter

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.870280Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.423969Z digest=sha256:2d5207599042d66e6f06237ea1365674c6da2c45cb400c8ee132383377a2f29d

Observation 8590a2c0-5e40-4575-bbc1-f14ab7ba74da · outbound

This paper cites The effects of reward misspecification: Mapping and mitigating misaligned models.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? The effects of reward misspecification: Mapping and mitigating misaligned models

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.858649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.427020Z digest=sha256:46d94f027fbc49986eff9c17469fb758efe7846f8767db977d3fb5e4dee03699

Observation 54f46a91-c27d-4127-9d08-f25b3ce50ebb · outbound

This paper cites Ball, Oleh Rybkin, Stephen Roberts, Tim Rocktäschel, and Edward Grefenstette.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Ball, Oleh Rybkin, Stephen Roberts, Tim Rocktäschel, and Edward Grefenstette

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.847364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.430298Z digest=sha256:e583b931cb4e108bc8b5c5da6aaddb8be5e7cb4339e3c798ee832cf7499313e2

Observation 406f1a71-0f7a-4a3b-89d3-d2544b369b2a · outbound

This paper cites Correlated proxies: A new definition and improved mitigation for reward hacking, 2024.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Correlated proxies: A new definition and improved mitigation for reward hacking, 2024

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.433343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.433343Z digest=sha256:9d5585582b4d5b72e4348c928beb39773bc9bbc75382fc8c08cf4ccc532a07c7

Observation cea58e23-3821-423b-96db-e25b04135b23 · outbound

This paper cites Inform: Mitigating reward hacking in RLHF via information-theoretic reward modeling.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Inform: Mitigating reward hacking in RLHF via information-theoretic reward modeling

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.829352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.436570Z digest=sha256:8fa3fd1a24c72d920cb3c660335e5c84294a9b87fbc3544724d9b2411f054b11

Observation 80e08e02-5c8f-49fd-9790-1f82d1c7f942 · outbound

This paper cites When Can Proxies Improve the Sample Complexity of Preference Learning?.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? When Can Proxies Improve the Sample Complexity of Preference Learning?

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:15:46.510460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.439486Z digest=sha256:55e2b06695145ffbfdfe46804cb2c12d54bfc597c0ba4a5cf1f5a657c5c19ee3

Observation d803e9ca-2919-40ff-b1af-1d9199def227 · outbound

This paper cites RLHF Workflow: From Reward Modeling to Online RLHF.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? RLHF Workflow: From Reward Modeling to Online RLHF

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.442619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.442619Z digest=sha256:63c37d7c9bc2937b9a982a0a3a8c562ef800d263614fe0b631ecad3d205e9ea1

Observation be2fa502-7c37-4c8e-8f45-2e9ed6e3baf4 · outbound

This paper cites an unresolved cited work.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.446051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.446051Z digest=sha256:6e5b24993034df9f55c4888c6478e4ecdf91f5fa7c682d6e55843de7166e2017

Observation 4e11cece-30f0-48d4-9926-ead2d5b0d7e2 · outbound

This paper cites Patterson, Joseph Gonzalez, Urs Hölzle, Quoc V.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Patterson, Joseph Gonzalez, Urs Hölzle, Quoc V

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.809151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.448967Z digest=sha256:447f93fa3f599389d632579d7f6cded24b94270f3c121a12c1a1beb1b5df4b50

Observation 17ab31b6-f920-40fa-8e10-4b4deff297ea · outbound

This paper cites OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.451629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.451629Z digest=sha256:eb09f641129e66710d967ea0a8d5fb92b4a75621e737edf1eb4a1d628b10f149

Observation dc602100-b4fc-47c2-9193-c4e43c8c19b9 · outbound

This paper cites Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint, 2024.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint, 2024

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.455296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.455296Z digest=sha256:5f2a10fc9e87b6aaa64fb8155161ca1e52c67b0d6bdd0a32270f814f13b3dc55

Observation 75172685-d121-4f34-a808-f78df1158f0f · outbound

This paper cites Hashimoto.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Hashimoto

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.458257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.458257Z digest=sha256:744e78b4bca378e6e23e13892aec47a2276c7aee15872b00d0b2ab72ff220fe5

Observation b6032cc0-7331-424c-9e6d-7ad104a6d1c8 · outbound

This paper cites Hashimoto.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Hashimoto

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:46.462329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.462329Z digest=sha256:e85ec74f69f14e226cb075a6a3ccde283263ea78b1f912f5ec84c4d2d16e6a50

Observation d1aa69f0-b56e-4868-ab57-addb7a5ebd00 · outbound

This paper cites Understanding dataset difficulty with V-usable information.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Understanding dataset difficulty with V-usable information

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:15:46.773272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:15:46.465735Z digest=sha256:7c75ef29b51a8772dd2b23d81e80c44c3a8f9fb534802e5b6742eff9a1c03946

Observation 0f4afe28-e1cd-4cad-a579-c1e49c088abb · outbound

This paper cites an unresolved cited work.

Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work

Reference 2024

Resolution
parse uncertain
no resolver link, observed 2026-08-07T15:15:46.364907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:46.364907Z digest=sha256:41339ca6b4aff63116a5b22b457f03093b77ed2c2bfcd2f4903fea5adbdc8a4b

Pith citing papers

No inbound Pith citation observations are available.