Pith. sign in

Paper Citation Record · LEDGER

Curiosity-Driven Reinforcement Learning from Human Feedback

As of 22 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2501.11463.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.11463 v2

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:21:37.480991Z

measured 59 of 59 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:50:28.097413Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T07:59:40.158119Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved52
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 75aaf1dd-d8b1-4051-8a58-6cb50b6fb916 · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

Curiosity-Driven Reinforcement Learning from Human Feedback Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.279408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.279408Z digest=sha256:53256e593040cd997035bce650e568288ab74af7d888391293a47d14374470e9

Observation 2b448799-681c-4306-a1f4-1edc01ff7d79 · outbound

This paper cites A General Language Assistant as a Laboratory for Alignment.

Curiosity-Driven Reinforcement Learning from Human Feedback A General Language Assistant as a Laboratory for Alignment

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.283993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.283993Z digest=sha256:28f737621d9b51d71345d50b9c3d51207a1041187d57d0fb9819228e16f42d20

Observation 23a26cf7-86d9-44bf-b0bf-abff340a0304 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Curiosity-Driven Reinforcement Learning from Human Feedback Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.288709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.288709Z digest=sha256:30e63c1981455e25cb9195ac3a87dcfa4da0c9c89a23641132116c976d18f557

Observation 48ae12b7-7a43-412d-897b-15367a132529 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:38.046913Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.293220Z digest=sha256:bce2cfd62921e6268fac54147e0465030aa392f5206fcd9dd2b09f07c77b0365

Observation f2faac84-9df4-4bec-aa82-43928cf6a9f8 · outbound

This paper cites Quality-Diversity through AI Feedback.

Curiosity-Driven Reinforcement Learning from Human Feedback Quality-Diversity through AI Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.297140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.297140Z digest=sha256:8494ded421c83c6433529c5f71123b89e99d6fd51c7bd2f81adeecbfc0ed7545

Observation 9e50ef19-dd91-4319-a18b-3e5a0390f9a4 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:38.035978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.301476Z digest=sha256:d83bba035f2ee0269d8870bcd668230d62c77adfb8a6be71ec03370192942da3

Observation 666cd16a-1fb7-4351-a0a0-c78a4cfa3bed · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:38.025470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.305587Z digest=sha256:cfbd0e8934f37a828b4731ec91a8b1a68ad364bcff11b3b6b6ba945bf315155e

Observation c9bdcca6-4cd8-4dbb-99c0-759070e88f8a · outbound

This paper cites Robust Preference Learning for Storytelling via Contrastive Reinforcement Learning.

Curiosity-Driven Reinforcement Learning from Human Feedback Robust Preference Learning for Storytelling via Contrastive Reinforcement Learning

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-10T18:21:37.718099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.309364Z digest=sha256:f4222fb85a3d592e3f745d6c9ee692db7fa72ea2f4fa104257ba971d96cb708d

Observation f1dda98a-c9c6-40e0-9824-1d24df36789d · outbound

This paper cites MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions.

Curiosity-Driven Reinforcement Learning from Human Feedback MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.313259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.313259Z digest=sha256:95b31065675e9e1be1b69b78960fe9f678bd8d5e44ee568760b9dc9fdb02700c

Observation 5ebe5560-1554-4741-9855-523088a1fb29 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.317295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.317295Z digest=sha256:ed354492f4b983a38acbb461cee3f08fa5bf954b94e92e8ff3a0cb1ae1a756c6

Observation 0ea5b238-dd95-4fb4-8867-54af34ec5c3f · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:38.014432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.321244Z digest=sha256:0decfa16e2b4b13b5ee39fb9b25d133567c69141707b2ea4da4e53c0e7bdfcd4

Observation 842d757c-ead6-4c2d-8ce0-a471e3e31bc0 · outbound

This paper cites Christiano, Jan Leike, Tom B.

Curiosity-Driven Reinforcement Learning from Human Feedback Christiano, Jan Leike, Tom B

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.324892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.324892Z digest=sha256:6fc9f575583ed5e7598fcfb8e1a2058f50c48900c240af80c88457ef299a085e

Observation fbeb767d-7f03-4b23-a49c-a90dbf7d9824 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Curiosity-Driven Reinforcement Learning from Human Feedback UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.328315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.328315Z digest=sha256:8fc898c030186e9e569a34e6ece531d827d6917d8811fc0fa8048a15b54b2402

Observation 6585c1d5-7de4-4f01-91df-cf180f67d474 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.996522Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.332092Z digest=sha256:48c6818a9e5f42c08aec64ddc56dc47047bf1428a8090b7529884b46264afb95

Observation 5e36b825-d1cf-4589-9f7b-27b6dede4d57 · outbound

This paper cites The Llama 3 Herd of Models.

Curiosity-Driven Reinforcement Learning from Human Feedback The Llama 3 Herd of Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.335631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.335631Z digest=sha256:459d53d47533615d253afd8a7996fb718847447cd2529b5436bebdfcafff21cf

Observation 39dea6f4-620d-4b49-a5b4-3a966585eaa4 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.984444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.339234Z digest=sha256:326eb18e8769a9a510e0d44de4f32877ce18f8ac897f67234736a07551a4ed62

Observation 18c92a1c-b7ba-4152-a81c-b2cac710e41e · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.973341Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.342916Z digest=sha256:82df093a9228ce0b1e2f42e8cd2c1b7b6cefe0b0bb1090c5c354311b2b3cf99e

Observation 1ecc97d1-0f34-4502-80d3-321822372c27 · outbound

This paper cites Glass, Akash Srivastava, and Pulkit Agrawal.

Curiosity-Driven Reinforcement Learning from Human Feedback Glass, Akash Srivastava, and Pulkit Agrawal

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:21:37.961763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.346335Z digest=sha256:17732cf22a9620ea1681ff943313f9be0e979d9f772df63ae3f638a8a6746c55

Observation b51389eb-5a07-410e-899b-9d179eee7150 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.351065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.351065Z digest=sha256:0c03a73e9e6ac2c94f27cd36e7dfe2bec8d481bcf297833f146cf3e7911bc1c4

Observation 6413a6cc-e154-43e1-8836-14f1a8c47f90 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.942518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.354487Z digest=sha256:164d4c705ad72ff379005e33703d953de201c247d2b7d3116aee969d78d194f0

Observation 125e65f3-5493-4cb3-96fd-4659e6c2d048 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.357924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.357924Z digest=sha256:4492620ec4c261f4c2900b83df9dbca2e6ada76ddbbf821aab45246580bcc417

Observation 22d86c07-4060-4598-a1d1-99bcc18ad473 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.361373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.361373Z digest=sha256:e3dd2d8ecb8eb84411a3909ad0a30f7ee8904812441ec2b9e665336b741c225d

Observation 9d0f8288-3628-4560-af52-5966ab4753d4 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.918197Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.364587Z digest=sha256:cc3a7d0dea1f8e8b93d402f1b5c119ac54b2970d1f3408d5c9f4d9e7122cc9d4

Observation 11c83419-a2d3-47d8-a4c9-2ad2b1337591 · outbound

This paper cites I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm.

Curiosity-Driven Reinforcement Learning from Human Feedback I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.367999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.367999Z digest=sha256:7403153b899d24df9c80e6c8fe11b5638b9f86264d78b58c0447efd3f6aa207c

Observation 159aa98e-5493-4cc1-b04e-153dc25cde4b · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.906475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.371511Z digest=sha256:45714fb0b46ae827dd123fb3f150840dffd1f2696ea1df5d73d4173d2c2fa311

Observation 73826fd4-a384-47c3-9445-292b58ca9ffd · outbound

This paper cites StarCoder 2 and The Stack v2: The Next Generation.

Curiosity-Driven Reinforcement Learning from Human Feedback StarCoder 2 and The Stack v2: The Next Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.374578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.374578Z digest=sha256:a40be8ad2386b2f0307f7aae78668c9159a72799286185ed525b12487d75dbdd

Observation b1848864-b63e-4121-9bf7-a0041bd85d02 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.894523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.378239Z digest=sha256:087025ce91a25cd251c377ab7a0af5205779fd4ef50b358e9fdc5d4e5f8e7e95

Observation f3e900cd-80be-470a-9a06-5f795c75c074 · outbound

This paper cites Bellemare, A \"a ron van den Oord, and R \'e mi Munos.

Curiosity-Driven Reinforcement Learning from Human Feedback Bellemare, A \"a ron van den Oord, and R \'e mi Munos

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:21:37.882827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.381680Z digest=sha256:78d3ed18e4d284ba5a434af8438f08336102ed54371e5cf902efd39c9523afd9

Observation 24ad0f3b-fb08-4d31-be67-10791b1ad772 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.384975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.384975Z digest=sha256:2ad4dfc9a8b3713dfec766468ee53245c7eba738f58509a14dd9b4f3d30323f3

Observation d9e33f2d-a512-4e51-90a8-fd0197310855 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.864901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.388190Z digest=sha256:97fece377ac75547f6f76baad362ad26f5935b32ae235bc3d7beae347658767d

Observation 1f42b683-9b06-4713-9877-755898c86271 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.391593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.391593Z digest=sha256:932a3a5230bce7ec7afbccbd76721a08b6179a1ef984f17496860fe54976d731

Observation 2b04304f-65e7-487a-9893-aab167ddb2c4 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.395201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.395201Z digest=sha256:2a0db4cf69a05f8aebf2f70ef99c432868bff309be84b5d7f5da086564b4d28c

Observation a42c2fe3-91bd-4bf5-abf6-c0c534bbc3a1 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.398679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.398679Z digest=sha256:1798ec0f0c22eda778723cfaea3489f1b7912bd07bf56ea5bb05918c12c9a7aa

Observation 0c38027f-6ba5-4ec3-9133-85a1c3cb501d · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Curiosity-Driven Reinforcement Learning from Human Feedback Code Llama: Open Foundation Models for Code

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.402322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.402322Z digest=sha256:549d6580509937a0cd95a3a58b10c7c1e867049f713f1598bcc053aafceab19b

Observation 1da51b33-7f97-4def-a11e-51c4077e6036 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.845834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.406397Z digest=sha256:63e8a7efdf5047c27adf47fc0b874077b1310975024138731b10102064b53b27

Observation 14f9ed15-7a7e-458f-9738-a57fd626bb02 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.834566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.410014Z digest=sha256:e5f48e5b973f907ae5ac58fa2f8a542f662a534d93c70b75a1a249dad3a7fb17

Observation ac394264-efe0-4f54-ab63-be50791917c2 · outbound

This paper cites Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models.

Curiosity-Driven Reinforcement Learning from Human Feedback Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.413739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.413739Z digest=sha256:fb621302294bfb76bdf14b6fd1b2fe36afaaf92c34171ba9a7874bb4de003d46

Observation 1a5e5681-7f98-48b0-8489-2c90bc12f057 · outbound

This paper cites Learning to summarize from human feedback.

Curiosity-Driven Reinforcement Learning from Human Feedback Learning to summarize from human feedback

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.417501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.417501Z digest=sha256:d1f18d0b5ebdff4edb33915867d266e513b03a3998f2a77326ed3cca441f4beb

Observation 853d3ae0-f135-4c9e-bd84-3094b2799e6b · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Curiosity-Driven Reinforcement Learning from Human Feedback Gemma: Open Models Based on Gemini Research and Technology

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.421348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.421348Z digest=sha256:c093a7d7968208e45b590a090f88e796745bf8285bc389e04f5be1678b034c21

Observation 73c0118b-78fe-46a0-ba7c-35517fe81d22 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.425001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.425001Z digest=sha256:92d23e0e7c924c4f5c6548816f43b01a5f6917c36984c12d7f33309bff4b8498

Observation e63fdbf0-1375-47de-9bdf-14c58977c34a · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

Curiosity-Driven Reinforcement Learning from Human Feedback Solving math word problems with process- and outcome-based feedback

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.428564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.428564Z digest=sha256:db976e56c074ef762192a76608d296c14d42c37873192550e8c5e090aa25e31b

Observation 6992dfdd-56f4-45eb-92eb-93f79a76edfd · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.823209Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.432569Z digest=sha256:982431e1b5aea316022ddfdd30826e8d2c065e0145859c567d4f393f2022f46f

Observation 374518da-571b-4f5c-8973-6f09962a0e53 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.811910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.436419Z digest=sha256:a26535085a8e75476107af0b7af922c3fbe7f684b043fa06198199814c6d4e55

Observation 899a1e39-071f-4e75-a52c-c0f63297ae94 · outbound

This paper cites Generative Monoculture in Large Language Models.

Curiosity-Driven Reinforcement Learning from Human Feedback Generative Monoculture in Large Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.440086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.440086Z digest=sha256:3bdfa906084baa75800d03f725610fda725487b33d66fc39db9785f0c34b3b08

Observation b99d810a-0b1b-4ab1-bb12-87fcabc06165 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.801664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.443950Z digest=sha256:2ee560ad0a39ec5c7adb45e08ce7235f66d84dfdf2170539d9ac8c1a7745f6eb

Observation 86be2fbe-e6bc-4699-9001-2d4920c47f3a · outbound

This paper cites WizardLM: Empowering large pre-trained language models to follow complex instructions.

Curiosity-Driven Reinforcement Learning from Human Feedback WizardLM: Empowering large pre-trained language models to follow complex instructions

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.447810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.447810Z digest=sha256:d4ae4ca451d844a562b88f129abbf38a31ffbb8a70d04a915ff3a357748b270f

Observation e0272511-cb13-4617-85da-c6a49d36e289 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.790889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.451459Z digest=sha256:881e683df3aab98c13ebf0e303abc70fd575e205b3c046284c7106ce60afbae8

Observation 2f8f7139-3aad-4d1e-916c-170fa4030d46 · outbound

This paper cites SEED-Story: Multimodal Long Story Generation with Large Language Model.

Curiosity-Driven Reinforcement Learning from Human Feedback SEED-Story: Multimodal Long Story Generation with Large Language Model

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.455009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.455009Z digest=sha256:60e1f0caad668a0139cd6ccf736f516128c272c4cb2fd3dbbcd4355178299d02

Observation 9fb83aab-dfe0-4eaa-83ea-22db674c60c9 · outbound

This paper cites DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales.

Curiosity-Driven Reinforcement Learning from Human Feedback DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.458748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.458748Z digest=sha256:19a6004efbb288dc6402e7ac7a8f379f2bff5044e10e44c939ec61ed4190fdc4

Observation b2eb9e11-3434-471e-95ae-9fe5d863cd18 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.462485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.462485Z digest=sha256:1bb6c64f25fd097f4ce7b701ab1c13f14e87f642ec825d3a15cb589f983ee2bb

Observation 631f5bbc-199c-44e1-b99f-bda9d3859013 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.466338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.466338Z digest=sha256:a63d7186afdf64194c36172dbf1fcd138329474f7b4143c89126be7d019f3e9a

Observation 5a8021b5-4082-424a-ba4e-fc28d6241e91 · outbound

This paper cites an unresolved cited work.

Curiosity-Driven Reinforcement Learning from Human Feedback Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-10T18:21:37.774174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-10T18:21:37.469750Z digest=sha256:dbe0a6bd2311219dd2763218a6c3e376a07b5e677ec8657577bcf3fa77cfa55b

Observation c206f32a-14d1-4478-a8e1-af62c62500df · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Curiosity-Driven Reinforcement Learning from Human Feedback Fine-Tuning Language Models from Human Preferences

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.473173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.473173Z digest=sha256:c24d567f562188de160a6aed6e00196af772532d67b9ebe1abd71126f24d4391

Observation 2f1d644f-fc87-4860-8618-e5a40ceaf127 · outbound

This paper cites online" 'onlinestring :=.

Curiosity-Driven Reinforcement Learning from Human Feedback online" 'onlinestring :=

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.476857Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.476857Z digest=sha256:6de2b9a82d57fa12a861cab93dcc3ebff4d7469fec75c6c0c7ed8fa58c144800

Observation fe0568f0-7da8-45a5-b224-a8057dea6954 · outbound

This paper cites write newline.

Curiosity-Driven Reinforcement Learning from Human Feedback write newline

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T18:21:37.480991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:21:37.480991Z digest=sha256:41c97c9f0edb25d8207633dc2da7dc26255e64adcb467f72469c14e37a6f5073

Pith citing papers

Observation c1f33125-130b-4524-aa1c-2a2cadc76e4a · inbound

Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey cites this paper.

Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey Curiosity-Driven Reinforcement Learning from Human Feedback

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-16T11:50:28.097413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:50:28.097413Z digest=sha256:cd8791acd49a1af511c9156c4591e019ed36b4fc32a32bf966175ee5cf819b37

Observation 67b78455-0897-42a2-acf6-43fce24cef22 · inbound

Avoidance Decoding for Diverse Multi-Branch Story Generation cites this paper.

Avoidance Decoding for Diverse Multi-Branch Story Generation Curiosity-Driven Reinforcement Learning from Human Feedback

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T11:56:55.153630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T11:56:55.153630Z digest=sha256:77019088c6757aea72b6f418db05f6d3e07ef7e9b92e4c624484ab7bf800b577

Observation 8ba30e36-23e4-44aa-bc17-7e45b0c1344d · inbound

Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity cites this paper.

Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity Curiosity-Driven Reinforcement Learning from Human Feedback

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T01:05:26.423214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T01:05:26.423214Z digest=sha256:aad89591c5934e3c9e7e7c13014e415e3aa968799c17aa35f2a55f277408c5dc

Observation 3383f364-3f79-4012-bfb2-90f49dbc3e79 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Curiosity-Driven Reinforcement Learning from Human Feedback

Reference 187

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.159435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:61b95d49065478e1561bf05ededb5b6a4b5114a7b550413339d9d6d57d43e854