Pith. sign in

Paper Citation Record · LEDGER

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

As of 23 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2602.02572.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2602.02572 v2

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T06:06:24.769271Z

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-27T16:26:34.918099Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-03T01:37:30.345559Z

Reference resolution

39 of 39 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a9b43f2f-0b80-497a-8fff-94c0d560866c · outbound

This paper cites Persistent anti-muslim bias in large language models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Persistent anti-muslim bias in large language models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.563977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.563977Z digest=sha256:bc780cdd37e59784040831a789df0b082b518739303d190c7b8fbf582c18e16a

Observation 3ff10d8f-afe3-464b-885a-22ea0178fcc6 · outbound

This paper cites In contrast, when B is large, expected user utility initially increases with α but eventually degrades.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective In contrast, when B is large, expected user utility initially increases with α but eventually degrades

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.469882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.469882Z digest=sha256:6030095f2f40269598d5465479a1069df678cd81a42080e690d858182a807952

Observation 9622f0a8-fff5-4af3-bc82-b2a5c317209b · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.831865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.831865Z digest=sha256:60d5e69eab3a5b4f1381ab351abd1df19de7c26da1cee90461d83c6cdd5f9d33

Observation 90cc93f8-760a-4fcb-ade0-71c938838865 · outbound

This paper cites Stackelberg game preference optimization for data-efficient alignment of language models.arXiv preprint arXiv:2502.18099,.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Stackelberg game preference optimization for data-efficient alignment of language models.arXiv preprint arXiv:2502.18099,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.892913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.892913Z digest=sha256:d98ccef1b7d6d38caca03854afe21ab1de696a13902befa37864495c587c2b7f

Observation a78b3777-1720-4aac-8f48-19dd7acb5fa7 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.938892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.938892Z digest=sha256:21ecd2bab43e2632ff66b8785d7ec9b94c697f3f8caea17a2c01234083ab12c3

Observation 19ef0cd4-3f38-4d63-9c94-f90d62084d57 · outbound

This paper cites The Llama 3 Herd of Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective The Llama 3 Herd of Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.100462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.100462Z digest=sha256:171e62a27549db576c2286900d74265c47b2bbc02cba86918c6767fee15b69d9

Observation d8a2cea7-0a82-4ab3-b5de-826e458c5c16 · outbound

This paper cites Principal-Agent Reinforcement Learning: Orchestrating AI Agents with Contracts.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Principal-Agent Reinforcement Learning: Orchestrating AI Agents with Contracts

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.215338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.215338Z digest=sha256:c8b7bafaaa77b184a454ccdaa418eea61079d270686d052a7f207c3d88766347

Observation a845c286-8195-4ab7-bcbb-6aaeb6d0cce3 · outbound

This paper cites Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.264628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.264628Z digest=sha256:95a7477042bb498514f6ddc9a05b519c20b2aa5443b37e1d82f08df2b9a60cbe

Observation 82323386-dc3b-43fb-a29d-cb314b8dfd28 · outbound

This paper cites Regularized best-of-n sampling to mitigate reward hacking for language model alignment.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Regularized best-of-n sampling to mitigate reward hacking for language model alignment

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.311851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.311851Z digest=sha256:162303a08debefa8784719ebbae55a1b0fc7fe7dc86329f3565a1bfaf9967adb

Observation 0ce5fda3-b4e0-4e8f-b7b2-94d90910bdd8 · outbound

This paper cites ARGS: Alignment as Reward-Guided Search.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective ARGS: Alignment as Reward-Guided Search

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.362311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.362311Z digest=sha256:d6e823fddbcd8b0a8749e4cc672ada8fa6b147eabc81a964fa84fea9f48389e4

Observation 377f2fb5-94e8-49db-a955-713eaa5d4c48 · outbound

This paper cites Aligning Large Language Models with Representation Editing: A Control Perspective.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Aligning Large Language Models with Representation Editing: A Control Perspective

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.421626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.421626Z digest=sha256:8f5660b17d3a88b0cb763e7bf66add126113bcef71ef9a0d6fb5d45c7cd082c6

Observation 6568c070-7823-4fa9-961a-a6cbb678375e · outbound

This paper cites CULTURE-GEN: Revealing Global Cultural Perception in Language Models through Natural Language Prompting.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective CULTURE-GEN: Revealing Global Cultural Perception in Language Models through Natural Language Prompting

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.465581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.465581Z digest=sha256:bddfb97ec71c3c3ab8b054c95bc1543f3cfd5007760e4ed6a68f0ef11831f675

Observation 22810edb-4870-4918-8036-4b85ba90efa3 · outbound

This paper cites Red: Unleashing token-level rewards from holistic feedback via reward redistribution.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Red: Unleashing token-level rewards from holistic feedback via reward redistribution

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.513804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.513804Z digest=sha256:b3fa8a43098563f0c0dc1d3782a2ba513dba37f51fb56cc4606f692393596dac

Observation d8e97ca9-2072-4292-bbb5-ae7ba90057e8 · outbound

This paper cites Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.565140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.565140Z digest=sha256:00aa8d3e43c607d1ec9df6165c17262f831b93b64521a25e01b7afcd862037b1

Observation dc54a390-813a-40cb-8573-e4fe20d25397 · outbound

This paper cites Controlled Decoding from Language Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Controlled Decoding from Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.621632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.621632Z digest=sha256:5607de7f460d3ab3482dbfd97d56256ac73b452a16b2b79dac54926b433313b3

Observation 68e8ef3f-021f-44f6-93f5-41c99cdb020c · outbound

This paper cites Of Models and Tin Men: A Behavioural Economics Study of Principal-Agent Problems in AI Alignment using Large-Language Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Of Models and Tin Men: A Behavioural Economics Study of Principal-Agent Problems in AI Alignment using Large-Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.680034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.680034Z digest=sha256:8d0903d9b642d10e612405e7ae0b9776b16bb666cc586631aece8883f8374af8

Observation f59d078f-612b-4b29-96c8-2b6e0079f15a · outbound

This paper cites Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.730311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.730311Z digest=sha256:6003f888c6cd204f9811a36899cbefa5c80387b95854929feaf6fdbb6261866d

Observation d21238ad-6117-4d70-b6d8-711f799a14eb · outbound

This paper cites Verbosity Bias in Preference Labeling by Large Language Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Verbosity Bias in Preference Labeling by Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.786849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.786849Z digest=sha256:d53f1e5354f2cb0f64b2ec6df1082df271f3c88d3afadf1953a500a2bac26005

Observation cf15c008-06bc-4e12-9c32-6ed24ac2e395 · outbound

This paper cites Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.835125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.835125Z digest=sha256:835c42660c209223b0322e7ab77d44c585c4b41f01db473f19de5bc9ac8a24d1

Observation 54b6b150-4c10-4454-83f9-c1108497a144 · outbound

This paper cites Robust multi-objective controlled decoding of large language models.arXiv preprint arXiv:2503.08796,.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Robust multi-objective controlled decoding of large language models.arXiv preprint arXiv:2503.08796,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.894260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.894260Z digest=sha256:67ab50d0a48a7d02fa29d9f1b3a1b064795c84313375db5b8671394ee1b427aa

Observation ee96b49f-3cc8-47e0-9d31-f77649e93a17 · outbound

This paper cites A Minimaximalist Approach to Reinforcement Learning from Human Feedback.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective A Minimaximalist Approach to Reinforcement Learning from Human Feedback

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.941662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.941662Z digest=sha256:bb67718116f5fcb3479809b28f00705b497f801354e57d02a448c177329c1bbe

Observation 1378a620-b05f-49a2-b875-d8cf129227b0 · outbound

This paper cites Transforming and Combining Rewards for Aligning Large Language Models.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Transforming and Combining Rewards for Aligning Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.003533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.003533Z digest=sha256:596d3622b05c5f9a9484b4b60a41e73d63def87bac9f26d1463a85b0cfbeb023

Observation 1272e9f4-5e14-47ea-9842-b35fa6d61fee · outbound

This paper cites GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.052889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.052889Z digest=sha256:b16984e1ef0d504b8687115974b0a246e1abcc7dba5615a326779ae8341a7fc6

Observation 2fbfd065-7f1f-43a4-81ba-b22b67e1d733 · outbound

This paper cites Qwen3 Technical Report.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Qwen3 Technical Report

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.108289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.108289Z digest=sha256:b00967813f9bd92e4516e4d62471e6b1d8b36311349976e39e53ef88e7844134

Observation e3367dc2-ea39-4b96-bdba-d8f844872624 · outbound

This paper cites Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.161428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.161428Z digest=sha256:ad2188d5d9ba92675050f2ce7c90a5e3952a4dd35e0862ee25816574c8797393

Observation 0f350215-e90e-4d8c-8481-074525852ad5 · outbound

This paper cites Fair-PP: A Synthetic Dataset for Aligning LLM with Personalized Preferences of Social Equity.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Fair-PP: A Synthetic Dataset for Aligning LLM with Personalized Preferences of Social Equity

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.211756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.211756Z digest=sha256:7f62f6714f282aeef37872cb4b9a76e617d8fc17f92ba0c6f7b89a0e5869bca7

Observation 376c0293-8980-46a2-b094-0c5def82af85 · outbound

This paper cites an unresolved cited work.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.278675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.278675Z digest=sha256:4dc5298ebe6915e535b5922f31f45498b5a444f06de4ee29ffec3652d877c659

Observation 5d396c6c-ed68-4576-a0a5-8507d036bfcf · outbound

This paper cites [2024], Ivanov et al.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective [2024], Ivanov et al

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.320298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.320298Z digest=sha256:79a32a2c2426570ff48d86311ffd58649b48c41a7b6ac3bee84b415f0f652257

Observation a068fe7e-abfb-4518-b45f-1a76a3203c66 · outbound

This paper cites an unresolved cited work.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.376327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.376327Z digest=sha256:4ace1ae1ee9c78c9d27fdc02d13a68c40529bbdac358012e5bf9a54a666dba36

Observation 09309d26-586a-432a-87ee-ab2c36c32fc2 · outbound

This paper cites The model generates responses for 1,000 test prompts, of which 300 are randomly selected for GPT-4 evaluation against base-policy answers generated without alignment.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective The model generates responses for 1,000 test prompts, of which 300 are randomly selected for GPT-4 evaluation against base-policy answers generated without alignment

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.418484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.418484Z digest=sha256:59126f55184bdd954d6715aea6824b0452b90d1a17a48371c4d954a26de13b26

Observation beff5586-f56f-4b10-a48f-b6c89cb1a75f · outbound

This paper cites This behavior indicates that the learned value function ˆQ(st,y ) fails to provide a meaningful estimate of the reward for expected model completions.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective This behavior indicates that the learned value function ˆQ(st,y ) fails to provide a meaningful estimate of the reward for expected model completions

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.553403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.553403Z digest=sha256:bd8aa1dd639e64512e0d8f18ef9d9a9fc1b27292ca290ed64b97a4ff59e62f07

Observation 9f475aac-43d3-4cff-be7b-a8c450338468 · outbound

This paper cites Recall we also have ˆQr ˆm∗,α(st, yt)≤r max ≤B.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Recall we also have ˆQr ˆm∗,α(st, yt)≤r max ≤B

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.668148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.668148Z digest=sha256:3f0d744d2791e6546a5bf9ff588e945d098d6a62f9eb1447730884768c447b43

Observation 93d8e8a8-237e-479a-8b2b-f3ce778c67c8 · outbound

This paper cites ""USER_PROMPT =.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective ""USER_PROMPT =

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:24.769271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:24.769271Z digest=sha256:406f6f715f18c64389fa0c5ec7978e7276b85d0517116e307795977aa6ddb3e3

Observation e2040902-8b98-4aa3-af64-9a23b8da6c4c · outbound

This paper cites Incomplete contracting and ai alignment.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Incomplete contracting and ai alignment

Reference 1992

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.160214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.160214Z digest=sha256:02c59b9dfd2aa132c812dda0bc5eb0b4ffd11df1ddd6a45fc0e7b8feab143b8c

Observation 2a86dd72-d410-4993-82f2-8181493fb18b · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.628259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.628259Z digest=sha256:9aa875b5613af96b89fd824e91ba5b74ea32fd951e3756e025fb73aeb2f8783b

Observation f658e658-2ded-4b04-b9a1-2270e55554e3 · outbound

This paper cites Reward shaping to mitigate reward hacking in rlhf.arXiv preprint arXiv:2502.18770,.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Reward shaping to mitigate reward hacking in rlhf.arXiv preprint arXiv:2502.18770,

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:23.051021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:23.051021Z digest=sha256:352eac3ce8cfd34fbd1f147d50c5ccfab979dc90cc1c8227d50eb210f4c3133e

Observation b613c101-70ea-4240-afab-6f13686e4075 · outbound

This paper cites Simple versus optimal contracts.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Simple versus optimal contracts

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.990060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.990060Z digest=sha256:3539c13b8e2fd56976f6710ed24542e494947e6bf20b8862057886b224bd582f

Observation 98511649-daee-476a-8d0a-5445a8933dcd · outbound

This paper cites Strategyproof reinforcement learning from human feedback.arXiv preprint arXiv:2503.09561,.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective Strategyproof reinforcement learning from human feedback.arXiv preprint arXiv:2503.09561,

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.681448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.681448Z digest=sha256:e69eeb7bda94edd16a58bb4cbdaf15bb9539630a0b447f7b04df93aade33f82f

Observation 259c1238-4e92-4686-b67a-8bcbf4f5ffce · outbound

This paper cites PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback.

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-03T06:06:22.768128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:06:22.768128Z digest=sha256:488ed2eb709eaa0fe7be5e48da0f9b14d5199e75bca91cfcb43e56d654c88080

Pith citing papers

Observation 9bbed268-4dad-4fd9-ad83-4b80970051af · inbound

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges cites this paper.

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

Reference 163

Resolution
verified exact
arxiv_id, observed 2026-06-09T03:07:10.188497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T13:58:53.430492Z digest=sha256:eb39fb9238a105706cd394f10a604254334f24865771e3b8be5241b91e0e1867

Observation d57426d3-0ff6-4fe3-8245-e818bf522e44 · inbound

Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization cites this paper.

Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

Reference 211

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T01:37:30.346928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-27T16:26:34.918099Z digest=sha256:25f8f46e640e00e19b40165d5d9e58ec6ddc9a1c9b203d0394ef686a5caaabcc