Pith. sign in

Paper Citation Record · LEDGER

Online Learning from Strategic Human Feedback in LLM Fine-Tuning

As of 22 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2412.16834.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.16834 v2

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T10:21:33.386906Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-09T16:38:06.631594Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-23T03:57:29.547083Z

Reference resolution

29 of 29 outbound references displayed

  • verified exact0
  • verified fuzzy15
  • unresolved12
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5581eb0b-618e-43bc-b1fc-f2c35210ed43 · outbound

This paper cites Open and ef- ficient foundation language models,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Open and ef- ficient foundation language models,

Reference 1

Resolution
malformed identifier
no resolver link, observed 2026-08-11T10:21:33.226742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.226742Z digest=sha256:442c5eaf0ec2093d844588c13f4fb857d8269a90e524704833e08ae609cbc206

Observation 080bf1ba-c99c-4b07-8e54-c0fd5fbf53e7 · outbound

This paper cites Openassistant conversations-democratizing large langu age model align- ment,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Openassistant conversations-democratizing large langu age model align- ment,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:34.048597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.233456Z digest=sha256:397c6e01832fb6f285ef2559a87badbc15f5e49b974c2a0a2d8a172f73b818cc

Observation 5d2cb5f1-e569-4123-ab5e-b8eb35a4e966 · outbound

This paper cites Mechanism design for llm fine-tuning with multiple reward models,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Mechanism design for llm fine-tuning with multiple reward models,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.238520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.238520Z digest=sha256:b67665ba8828af0dd8d5aedf0d98c5caf59b1d57b05638f7b995c206ac1df749

Observation 659ffb1b-6c6c-4db9-88ae-034280e88d3e · outbound

This paper cites Deep reinforcement learning from human preferences,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Deep reinforcement learning from human preferences,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:34.026522Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.243718Z digest=sha256:10e2f0f286c4796f6c72a07118a567dcbf42d5c157a3d463e0265ae41d514f97

Observation 13afe7f0-dfec-4ad9-804a-edc1f1c76c0e · outbound

This paper cites Training language models to follow instructions with human feedback,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Training language models to follow instructions with human feedback,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.249324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.249324Z digest=sha256:746cd386cb80b28a8917ceaf097b9a9c00e3ece60dc6e3268f7eb5124dc140bd

Observation 2201e4b3-4a35-4481-b6e3-61ef869d996b · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 6

Resolution
malformed identifier
no resolver link, observed 2026-08-11T10:21:33.254896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.254896Z digest=sha256:5903be98446b5819c2a5bced57513c021d2a72a902cd52b1f92171ad4610775a

Observation d64fcd5f-ca12-4676-be30-df721c4eb9aa · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.262991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.262991Z digest=sha256:d7c5aa97f4cc10d848093db34baa1f02ae61eaedac63d187a64f03fb9de4a19e

Observation e9fa04d5-8af8-470f-86fe-f46f49dce922 · outbound

This paper cites Iterative preference learning from human fee dback: Bridging theory and practice for rlhf under kl-constraint,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Iterative preference learning from human fee dback: Bridging theory and practice for rlhf under kl-constraint,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.992234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.268414Z digest=sha256:03d363e2f76cbb75b933269f72adc1c99a245c9b94ddcb3a113bc9a421e43e60

Observation 84f3f08e-0452-40bb-8c30-f96e7e88307a · outbound

This paper cites Truthful Aggregation of LLMs with an Application to Online Advertising.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Truthful Aggregation of LLMs with an Application to Online Advertising

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.274599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.274599Z digest=sha256:1bc48c74103637ec9d1dab5b128ccd59c83b17cbe44287b38ea226b56280a565

Observation 1aa31b4f-9400-49ad-8cf5-4aa5b510fff6 · outbound

This paper cites Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.280224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.280224Z digest=sha256:71b7a1ce953996c8affeab5970877ea9c5bde959723cf88acc0929e7030e5dc0

Observation fc9a329d-d042-488a-a3e7-8775e9c19de6 · outbound

This paper cites Online prediction w ith selfish experts,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Online prediction w ith selfish experts,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.974378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.286531Z digest=sha256:6047eb3dbfc15828304c5d8e64d922337fe1a8a10034156df9d48621a329b687

Observation 1ceec05b-4d48-4569-ba79-91279ec29a70 · outbound

This paper cites Direct preference optimization: Y our language mo del is secretly a reward model,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Direct preference optimization: Y our language mo del is secretly a reward model,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.951188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.292087Z digest=sha256:88f9891a46620fb57fc785b8118e18b9eed8674246a4447b5b013890a0d57b3a

Observation bf8c9c6e-1d9c-4cd5-856b-2f461b19f5b9 · outbound

This paper cites Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.298781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.298781Z digest=sha256:f888b59e7231be155de7cf2bcbdefca6075bcc7047ff3a4b8ada4f056aac9f72

Observation 22f9dbe2-1194-4ba6-a6ce-6bcf58055ccf · outbound

This paper cites Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.305260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.305260Z digest=sha256:8b29b8ebfd675f6e7a6f903b268367ab7f3e701539c809469ff8753929a0deb0

Observation 770af17c-b057-4d2b-8d01-158888e17854 · outbound

This paper cites Self-Exploring Language Models: Active Preference Elicitation for Online Alignment.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Self-Exploring Language Models: Active Preference Elicitation for Online Alignment

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.311936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.311936Z digest=sha256:17011e5b3f36653125dd83e21cf1181961360b4be30758208761a4cf7f10b4e7

Observation 64b23332-c366-4c73-87c2-e633713626e4 · outbound

This paper cites OPTune: Efficient Online Preference Tuning.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning OPTune: Efficient Online Preference Tuning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.317740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.317740Z digest=sha256:1483daec1e7a25980a047e3e8193da8d6390f4631c697947b66edbc7c160fa28

Observation 57010b3c-4180-449f-97b4-8e19fc0d0e30 · outbound

This paper cites Rl hf from heterogeneous feedback via personalization and preferenc e aggregation,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Rl hf from heterogeneous feedback via personalization and preferenc e aggregation,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.931200Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.324351Z digest=sha256:83e5efcf8b5b9aaf08d979bfbfe459d41ab21e0cd65e716321e840015d6318b2

Observation 0065d0fc-4288-4c1f-bc2d-dcd572a60ec3 · outbound

This paper cites Auctions with LLM Summaries.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Auctions with LLM Summaries

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.330873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.330873Z digest=sha256:60a801fe36beb6f104b78b7a11300d5e30e46b4c8873674a13cdc1f470638896

Observation 7a1be47e-1fa3-4e51-b83a-ef1b41116068 · outbound

This paper cites Co llaborative algorithms for online personalized mean estimation,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Co llaborative algorithms for online personalized mean estimation,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.913419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.336356Z digest=sha256:eed733b7230b3640e4a8e92840cacfa2e5a4f9c07d2998f524fa5ea8560caa83

Observation 6417fda4-3096-4ec6-acf2-616faec6f01b · outbound

This paper cites Mechanism design for col- laborative normal mean estimation,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Mechanism design for col- laborative normal mean estimation,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.894481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.341701Z digest=sha256:4975dbb155bd63b6293d5bc818a9e4a443041aa95da2f0e0dd43ad9e1ba5813a

Observation eb98fa7f-171c-44ed-b445-fa521143fb8f · outbound

This paper cites Strategyproof mechanisms for group- fair obnoxious facility location problems,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Strategyproof mechanisms for group- fair obnoxious facility location problems,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.872552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.346913Z digest=sha256:0ddfa47f6e77e4fc2fa1f6b2d60b6be62a56317d16a98c7f234914eba9ac8ab3

Observation f59b7e01-752d-4ea8-88fa-29e8daedd497 · outbound

This paper cites Positive intra-group exter nalities in facility location,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Positive intra-group exter nalities in facility location,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.854554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.351756Z digest=sha256:656f6274ccfb087b6a6482d7b78d72a1f531639b7f5d3998539605686b200bdb

Observation 102e7f13-4d9e-4e7b-b86e-24dd6689a6e8 · outbound

This paper cites Dueling RL: Reinforcement Learning with Trajectory Preferences.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Dueling RL: Reinforcement Learning with Trajectory Preferences

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.356599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.356599Z digest=sha256:5246074c75f280bd93e89d97f324f2a86daa72f62f4c4cb1b317497cbb4ee2b0

Observation 2834b20f-dec2-43fe-9d11-f6a871fb107c · outbound

This paper cites Human-i n- the-loop: Provably efficient preference-based reinforcem ent learning with general function approximation,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Human-i n- the-loop: Provably efficient preference-based reinforcem ent learning with general function approximation,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.829225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.361608Z digest=sha256:9b744183f6f5b9edb95a700c732ed227a036b5f887b62b68f18c927bd0d43fe0

Observation cac1b905-4782-4861-851b-c2214bd75009 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T10:21:33.365940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:21:33.365940Z digest=sha256:fb182fb7abf9218f5fed335ab961feaac5d8cddc7c4ec58f6d2a76d6343d3c84

Observation 8a179afb-9f1c-45ea-8f62-8831a933f466 · outbound

This paper cites E fficient com- petitions and online learning with strategic forecasters,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning E fficient com- petitions and online learning with strategic forecasters,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.810635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.370970Z digest=sha256:06afbd0c4ef52bb65efaceb1140efdf095a3275f2e43d4315d6e431ad92ac59e

Observation e64388f0-e0a5-4448-a6ad-1238f6fb6213 · outbound

This paper cites No-regret and incentive-compatible online learning,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning No-regret and incentive-compatible online learning,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.786016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.376879Z digest=sha256:ab74ec6b7668c186d6b8bf10fb4324e3d993a877c80d187e750a64ae77e0bbb7

Observation f2b7db93-697f-4409-934e-07d819ea4fd0 · outbound

This paper cites trlx: A framework for large s cale rein- forcement learning from human feedback,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning trlx: A framework for large s cale rein- forcement learning from human feedback,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.765555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.381651Z digest=sha256:3e11c7e384d12b6b746ff45267b7091df4067df674cee1bb2a8ca1c9585daec5

Observation d03a433a-d317-4c59-b926-19421549c927 · outbound

This paper cites Tl; dr: M ining reddit to learn automatic summarization,.

Online Learning from Strategic Human Feedback in LLM Fine-Tuning Tl; dr: M ining reddit to learn automatic summarization,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:21:33.747141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-11T10:21:33.386906Z digest=sha256:f6fbbf6ad19a385309436f9504673579a35765452f41ff2923b7b7ba6224e819

Pith citing papers

Observation e4c26c1d-ba06-405a-9602-c300644a5c25 · inbound

The Battling Influencers Game: Nash Equilibria Structure of a Potential Game and Implications to Value Alignment cites this paper.

The Battling Influencers Game: Nash Equilibria Structure of a Potential Game and Implications to Value Alignment Online Learning from Strategic Human Feedback in LLM Fine-Tuning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T16:38:06.631594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T16:38:06.631594Z digest=sha256:da20868ec88d0088546f42de1bb5bcb5605833020b139958db3140b8d9729432

Observation e86a58fa-c6b6-4bea-968b-51222439eda9 · inbound

How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators cites this paper.

How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators Online Learning from Strategic Human Feedback in LLM Fine-Tuning

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-23T03:57:29.550406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-23T03:56:18.703995Z digest=sha256:52e0abed6752901aee9e8aa9a8cec5b31f13af6adab5a34eaf9d71cfa550a9af

Observation a8d5d594-0c3c-4105-980d-49db6e563d74 · inbound

Incentivizing High-Quality Human Annotations with Golden Questions cites this paper.

Incentivizing High-Quality Human Annotations with Golden Questions Online Learning from Strategic Human Feedback in LLM Fine-Tuning

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-19T13:42:19.382745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-19T13:41:26.730528Z digest=sha256:63ae8ff645f52a0b28164a31e750d0e327c23418ae0fd34f71173cfe1babe29e