{"as_of":"2026-08-08T21:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b355756943455d03e61b5a42dcfbc17be963a3bc21003f9e00c7151113e79fdc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:59.151835Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:55.291550Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-07T12:12:59.151835Z","title":"B-pref: Benchmarking preference-based reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-07T15:00:04.313363Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:59.151835Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:bf7f7cfb6bcc851e16c69030b91aaa1875d5ea0be0e69d37c72a5e579dd95a0b","observation_id":"6c8e3ae6-9185-403b-869a-96c023284f05","resolution":{"observed_at":"2026-08-07T12:12:59.151835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2111.03026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-07-03T20:48:55.291550Z","title":"B-pref: Bench- marking preference-based reinforcement learning","venue":null,"work_id":"4fafbd49-9d0f-4acc-ac9d-831490cb20e6","year":2021},"citing_paper":{"arxiv_id":"2506.14648","last_updated":"2026-05-21T02:08:17Z","snapshot_observed_at":"2026-07-06T21:43:40.740750Z","submitted_at":"2025-06-17T15:42:19Z","title":"SENIOR: Efficient Query Selection and Preference-Guided Exploration in Preference-based Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:27:48.404574Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2506.14648"},"observation_digest":"sha256:c90c57c17f92af732543fa646489e46faf4b2c8ce762a51a28ebaf8f6f23df4b","observation_id":"24401624-3f64-45b6-974b-497b82a7e2aa","resolution":{"observed_at":"2026-05-22T13:31:36.483140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-06T21:17:36.177037Z","title":"B-pref: Benchmarking preference-based rein- forcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00611","last_updated":"2025-07-01T09:43:57Z","snapshot_observed_at":"2026-08-06T21:08:39.566215Z","submitted_at":"2025-07-01T09:43:57Z","title":"Residual Reward Models for Preference-based Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:36.177037Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2507.00611"},"observation_digest":"sha256:1c820ca9223f0a70e24906287e17f9e35e444a96d8cac5ea047bfa9c4fe25be6","observation_id":"2008bc99-63a9-45f6-a8d6-65db77f15d1b","resolution":{"observed_at":"2026-08-06T21:17:36.177037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-03T07:11:58.497511Z","title":"B-pref: Benchmarking preference- based reinforcement learning.arXiv preprint arXiv:2111.03026, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.21166","last_updated":"2026-06-22T00:23:06Z","snapshot_observed_at":"2026-08-08T01:56:52.723455Z","submitted_at":"2026-01-29T02:08:41Z","title":"Noisy Pairwise-Comparison Random Search for Smooth Nonconvex Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T07:11:58.497511Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2601.21166"},"observation_digest":"sha256:c5060efbf07067a3967ba4113bba82dd365486ab854c43e3696d802bb4a17652","observation_id":"5ce0f7eb-0a35-4037-804f-b2735b8bd671","resolution":{"observed_at":"2026-08-03T07:11:58.497511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2111.03026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-07-03T20:48:55.291550Z","title":"B-pref: Bench- marking preference-based reinforcement learning","venue":null,"work_id":"4fafbd49-9d0f-4acc-ac9d-831490cb20e6","year":2021},"citing_paper":{"arxiv_id":"2605.21822","last_updated":"2026-05-20T23:44:06Z","snapshot_observed_at":"2026-08-03T02:30:10.701058Z","submitted_at":"2026-05-20T23:44:06Z","title":"Implicit Safety Alignment from Crowd Preferences","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-22T08:28:41.652865Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2605.21822"},"observation_digest":"sha256:fffc7a5c2a2de4b3ddd5d32ae628e544ee704ee5d108bff1902d13392cd4d9bc","observation_id":"d45a0a9f-bd43-4eab-b7a9-deefbdc3026c","resolution":{"observed_at":"2026-05-22T08:31:16.874767Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2111.03026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-07-03T20:48:55.291550Z","title":"B-pref: Bench- marking preference-based reinforcement learning","venue":null,"work_id":"4fafbd49-9d0f-4acc-ac9d-831490cb20e6","year":2021},"citing_paper":{"arxiv_id":"2607.00483","last_updated":"2026-07-02T01:53:18Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T06:11:59Z","title":"VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-02T11:52:25.035266Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2607.00483"},"observation_digest":"sha256:1eeb05fe174f1b472d643940470d03515660291440e3e480cd16ef6362a47357","observation_id":"c54e5b02-ea09-4aac-9877-3a96cbf5c66f","resolution":{"observed_at":"2026-07-02T11:56:54.917868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2111.03026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-07-03T20:48:55.291550Z","title":"B-pref: Bench- marking preference-based reinforcement learning","venue":null,"work_id":"4fafbd49-9d0f-4acc-ac9d-831490cb20e6","year":2021},"citing_paper":{"arxiv_id":"2607.00483","last_updated":"2026-07-02T01:53:18Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T06:11:59Z","title":"VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-03T20:43:34.222848Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2607.00483"},"observation_digest":"sha256:140ae083d88c5c536dce7edd1c64f371170e5add10f7045ca4e3b94d13c27177","observation_id":"15a3bbb3-ddfb-4db5-a814-189060f48ae2","resolution":{"observed_at":"2026-07-03T20:48:55.293388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-02T06:06:14.354404Z","title":"arXiv:2111.03026 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13172","last_updated":"2026-07-14T18:22:14Z","snapshot_observed_at":"2026-08-08T05:07:31.739333Z","submitted_at":"2026-07-14T18:22:14Z","title":"Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T06:06:14.354404Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2607.13172"},"observation_digest":"sha256:39fce74233ebed4e3e24788afd88b07f81b4f55a9dd08c1aba66695a27b41658","observation_id":"dcfcf58d-0322-4365-a1e0-dcd6d8635859","resolution":{"observed_at":"2026-08-02T06:06:14.354404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2111.03026/citation-record","integrity":"/paper/2111.03026/integrity","json":"/paper/2111.03026/citation-record.json","paper":"/paper/2111.03026"},"outbound":[],"paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2111.03026."}