Pith. sign in

Paper Citation Record · LEDGER

B-Pref: Benchmarking Preference-Based Reinforcement Learning

As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2111.03026.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2111.03026 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T18:15:15.679844Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T20:48:55.291550Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 7ee81ae3-a319-40c0-a8bc-f6cbcea98d0c · inbound

Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework cites this paper.

Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 102

Resolution
unresolved
no resolver link, observed 2026-08-12T18:15:15.679844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:15:15.679844Z digest=sha256:f597d3f9d1392351800ed8343f0ba6f4ad1ba14aae6b46d42f542245899eb671

Observation 0a9cf673-0dc8-42a6-9636-e1863eafc5ea · inbound

Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model cites this paper.

Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T06:05:40.169940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T06:05:40.169940Z digest=sha256:711c5310520d9e3fef8dd0746fe5c8bba968b996117196aadb5042e321f26ae6

Observation 2d161150-d572-4476-80d5-73a31a3f35e3 · inbound

Performance Optimization of Ratings-Based Reinforcement Learning cites this paper.

Performance Optimization of Ratings-Based Reinforcement Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T20:40:11.503146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T20:40:11.503146Z digest=sha256:d1c67fa8a095c39f828ff70e003abd719f694a4d34372873f1877844e3e03272

Observation 36d0384a-c41d-4b7b-8547-6004e5a37dce · inbound

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning cites this paper.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.141508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.141508Z digest=sha256:b5fd9f707711856fc5822b07674a1a4e9d305afd1a41beccdbb388ba5eefdba5

Observation 6c8e3ae6-9185-403b-869a-96c023284f05 · inbound

CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries cites this paper.

CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T12:12:59.151835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:12:59.151835Z digest=sha256:8d91e8b7b01dc314c3c60d676ec52409564320a13cd4e10b8f63e1a1b549fcad

Observation 24401624-3f64-45b6-974b-497b82a7e2aa · inbound

SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning cites this paper.

SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-22T13:31:36.483140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-22T13:27:48.404574Z digest=sha256:43b0d79f44c1a401c5c195d20c2e322c5ec4db15778b32b7cd0dc96b10e62d2a

Observation 2008bc99-63a9-45f6-a8d6-65db77f15d1b · inbound

Residual Reward Models for Preference-based Reinforcement Learning cites this paper.

Residual Reward Models for Preference-based Reinforcement Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T21:17:36.177037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:17:36.177037Z digest=sha256:fff2606429437cc1c5c17fef4d928fe36bb5a1c53eb68149d126bbddd504231e

Observation 5ce0f7eb-0a35-4037-804f-b2735b8bd671 · inbound

Noisy Pairwise-Comparison Random Search for Smooth Nonconvex Optimization cites this paper.

Noisy Pairwise-Comparison Random Search for Smooth Nonconvex Optimization B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T07:11:58.497511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T07:11:58.497511Z digest=sha256:2135f77c4bdbccc4dacd0dc1d8cbf8c551b1eb8671ae77308459bd2f67a13401

Observation d45a0a9f-bd43-4eab-b7a9-deefbdc3026c · inbound

Implicit Safety Alignment from Crowd Preferences cites this paper.

Implicit Safety Alignment from Crowd Preferences B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 24

Resolution
metadata mismatch
arxiv_id, observed 2026-05-22T08:31:16.874767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-05-22T08:28:41.652865Z digest=sha256:0e3d26ccca0d2516b7da614a5bb40c9760cfd826a9b1a3c5a35c82a83c8250f1

Observation c54e5b02-ea09-4aac-9877-3a96cbf5c66f · inbound

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning cites this paper.

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T11:56:54.917868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-07-02T11:52:25.035266Z digest=sha256:bd23013f7b84226c35bfd1c2a6ffd09fb7d9c5d8472ab4ca4cb5c25cdc83d3f3

Observation 15a3bbb3-ddfb-4db5-a814-189060f48ae2 · inbound

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning cites this paper.

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T20:48:55.293388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-07-03T20:43:34.222848Z digest=sha256:5548caca323231cc31afddcc736646c992a324b3e3b45bdac927cc223efab703

Observation dcfcf58d-0322-4365-a1e0-dcd6d8635859 · inbound

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models cites this paper.

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-02T06:06:14.354404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T06:06:14.354404Z digest=sha256:69a062e399924fa34f6e23bb67192c8ec7a2217884cf05490cc116470468979e