Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Learning from Multi-level and Episodic Human Feedback

As of 17 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2504.14732.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.14732 v3

Coverage vector

measured 12 of 12 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:47:06.636420Z

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

12 of 12 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7dc0ae4c-2657-497d-bf44-2b8eb12c8231 · outbound

This paper cites Proof of Theorem 3 The optimistic reward function is defined as follows: R(bwn,τ ) = min R(bwn,τ ) + 4Kexp(4B) ηλmin(ΣDn) r C2 2n log 4 δ, K− 1.

Reinforcement Learning from Multi-level and Episodic Human Feedback Proof of Theorem 3 The optimistic reward function is defined as follows: R(bwn,τ ) = min R(bwn,τ ) + 4Kexp(4B) ηλmin(ΣDn) r C2 2n log 4 δ, K− 1

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:47:06.743327Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:47:06.636420Z digest=sha256:cff412e014ac88b387c336d32a7b6c5ab303ba6c4552edb596c5926ea7ba811b

Observation 83dd88f6-48f6-4f8b-9526-e7840fc9eb7d · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Reinforcement Learning from Multi-level and Episodic Human Feedback Playing Atari with Deep Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.613621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.613621Z digest=sha256:416de623eefc9f4249fc2365864a914f380a1d3fed1d8315d6a90328b807636b

Observation 9422b27b-8d00-417b-b05b-bc5ffe9b67d1 · outbound

This paper cites Dueling RL: Reinforcement Learning with Trajectory Preferences.

Reinforcement Learning from Multi-level and Episodic Human Feedback Dueling RL: Reinforcement Learning with Trajectory Preferences

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.622258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.622258Z digest=sha256:b3004c70b80d70877c1258e4e6adaeaf091f280f8d7d9d7733b9624b26f90a43

Observation fd920b3a-51b6-46b1-ba3c-441ec1baea27 · outbound

This paper cites Benchmarks and Algorithms for Offline Preference-Based Reward Learning.

Reinforcement Learning from Multi-level and Episodic Human Feedback Benchmarks and Algorithms for Offline Preference-Based Reward Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.625647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.625647Z digest=sha256:5c5c125d94899a3ccc848d89cba21f64c939d8034c024cb323e39a43b93332c2

Observation 073d7591-ac3d-45bb-bbc8-532936bd7d35 · outbound

This paper cites Is RLHF More Difficult than Standard RL?.

Reinforcement Learning from Multi-level and Episodic Human Feedback Is RLHF More Difficult than Standard RL?

Reference 2005

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.629390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.629390Z digest=sha256:9cc5faaaab742323ed0b6ca835046a64d6b45deba271251e23ecdb3b8304b14c

Observation b15f9e9f-7c11-4329-8018-8987f5ea50ea · outbound

This paper cites Tamer: Training an agent manually via evaluative reinforcement.

Reinforcement Learning from Multi-level and Episodic Human Feedback Tamer: Training an agent manually via evaluative reinforcement

Reference 2013

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:47:06.762946Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:47:06.607554Z digest=sha256:f2ecbcf48f5542b6f8eb3135987f5ed464c17df52584d697c2cba0f757c024b5

Observation 0d9849dd-3b73-4e28-9b55-105f62577960 · outbound

This paper cites Provable Offline Preference-Based Reinforcement Learning.

Reinforcement Learning from Multi-level and Episodic Human Feedback Provable Offline Preference-Based Reinforcement Learning

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.632746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.632746Z digest=sha256:212735394335a6c4ef9e8a51a607d75fca62c9e5c806be8da5f4f18b06131032

Observation 34bfff6d-8e60-41a9-b0fc-719573c10ef4 · outbound

This paper cites Inverse Reinforcement Learning by Estimating Expertise of Demonstrators.

Reinforcement Learning from Multi-level and Episodic Human Feedback Inverse Reinforcement Learning by Estimating Expertise of Demonstrators

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.599283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.599283Z digest=sha256:ce201c87e0993c922a536182d22db10877e44e54bd728849c62981fce0c16edd

Observation 03cfa0b1-3e01-4f43-97c0-6fbb73a6b765 · outbound

This paper cites Inverse reinforcement learning with learning and leveraging demonstrators’ varying expertise levels.

Reinforcement Learning from Multi-level and Episodic Human Feedback Inverse reinforcement learning with learning and leveraging demonstrators’ varying expertise levels

Reference 2020

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:47:06.752804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:47:06.616791Z digest=sha256:59503ce8d1900a18bff1b8dc4322006ac9aef1c87687ba546eeca998dc68acb5

Observation 8b0bccfa-c0d6-4eb7-8844-7b91015e5161 · outbound

This paper cites Diversity is All You Need: Learning Skills without a Reward Function.

Reinforcement Learning from Multi-level and Episodic Human Feedback Diversity is All You Need: Learning Skills without a Reward Function

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.603640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.603640Z digest=sha256:49d05c5ef14e0fea5443b7f7b88d148dea101cff63418620c5aba16a76f3cde7

Observation 045ae104-de2c-4a14-a542-e9a172f9d9da · outbound

This paper cites Regret Bounds for Discounted MDPs.

Reinforcement Learning from Multi-level and Episodic Human Feedback Regret Bounds for Discounted MDPs

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.610498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.610498Z digest=sha256:8f075ceaed5b2bdad6c37ad9d162d933a2c459f02a8d96257bd68a645eb5cad9

Observation e4d25f93-6eda-42bf-9b74-568c7980d848 · outbound

This paper cites On Lower Bounds for Regret in Reinforcement Learning.

Reinforcement Learning from Multi-level and Episodic Human Feedback On Lower Bounds for Regret in Reinforcement Learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:06.619644Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:06.619644Z digest=sha256:caafb5aa18bcb5c16ecd55451d692e304bf0c7f95597831eb7e2e3dee972a52c

Pith citing papers

No inbound Pith citation observations are available.