{"as_of":"2026-08-10T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:613db12ea7c45443ef35807ef59219dbe228d4fc83e757c991e5d47424c0e90b","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:43:29.936815Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02921/citation-record","integrity":"/paper/2502.02921/integrity","json":"/paper/2502.02921/citation-record.json","paper":"/paper/2502.02921"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T10:43:28.811463Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.811463Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:dc38effaf8d0a988397c6f65f6264c80d23a3f1c3e0a835de5ce89eb94a57288","observation_id":"c90ea59d-776a-4812-be9d-b6bbc4d740a8","resolution":{"observed_at":"2026-08-09T10:43:28.811463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:28.814983Z","title":"April: Active preference learning-based reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.814983Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:595edd571c3903c3920b7329626d899feddc83990b4e72deb190715b1bcbe8dc","observation_id":"f72cd497-3718-4577-b12b-5f3fd559a746","resolution":{"observed_at":"2026-08-09T10:43:28.814983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:31.006444Z","title":"Programming by feedback","venue":null,"work_id":"6f057b65-43c1-4327-929b-e858da41f7f5","year":2014},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.817953Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:2705a4f52975928825a1592b4d43f67ce1e3683f3d589bcd4f686037ac32d6af","observation_id":"6caed3f8-8e48-47b1-b2dc-50f7a5c7e7ad","resolution":{"observed_at":"2026-08-09T10:43:31.054467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.893558Z","title":"K., Anil, R., and Koren, T","venue":null,"work_id":"62062f6f-7a48-4759-8a2a-a9fbd314f8a5","year":2019},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.820995Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:15f669dd596b89c33fe628be73354c8df4b95e1fe2ba9d9233407c3a5d75132b","observation_id":"47dc248a-b856-4cd0-95b0-e0b1eaa7db73","resolution":{"observed_at":"2026-08-09T10:43:30.956444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:28.823812Z","title":"Fine-tuning language models to find agreement among humans with diverse preferences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.823812Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:58f7a20ab954281b7206903a557fe8b49ebea939ad10dc39157ee34671a166b7","observation_id":"46256e2b-c53c-4186-97b0-34bce3b35b05","resolution":{"observed_at":"2026-08-09T10:43:28.823812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:28.826189Z","title":"L., Harvey, N., Liaw, C., and Mehrabian, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.826189Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:2a9db03e73df74c09665bfe547f066b5eda6ca0cba7a65ec76a943631ac22bc6","observation_id":"8d415488-0680-4e94-b953-c9f1da5d1dbb","resolution":{"observed_at":"2026-08-09T10:43:28.826189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.793514Z","title":"and Sadigh, D","venue":null,"work_id":"6bc8ff96-48cf-4ba3-9993-049e9172f36b","year":2018},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.828918Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:47ff133f809d790c8357c7b2949d67b211269c6c6c12afad844af478ebb4fcf2","observation_id":"baa68838-deda-4f74-a280-a177ebdb6271","resolution":{"observed_at":"2026-08-09T10:43:30.834634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.786213Z","title":"Batch active learning of reward functions from human preferences","venue":null,"work_id":"4a7a993b-862a-463c-b29d-a6be14eee05e","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.831254Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:849bd05974e024ebd87e4c9ee59674b206bf6832e57584c69ea66ae81689d8aa","observation_id":"aea9c93c-9e6c-447a-b4f4-e2a9186800b8","resolution":{"observed_at":"2026-08-09T10:43:30.788939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.779282Z","title":"J., and Sadigh, D","venue":null,"work_id":"06377485-53f2-4e98-87b6-7b6f3b741b08","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.833947Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:803cd8388f1b9dcf144c4e42200d15a3a9979bf48192d0c9093c9f98b9e95f46","observation_id":"7cf28edb-17f1-4b13-a035-419a8b36a5b0","resolution":{"observed_at":"2026-08-09T10:43:30.781660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:28.836824Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.836824Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:a2b2f8458188076e9bb5dcb9d0c45a0d6a69c153865872e27e5fc3c23ec9f61c","observation_id":"79b9f3ad-7e0b-4948-80c6-501a781abbf9","resolution":{"observed_at":"2026-08-09T10:43:28.836824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.768149Z","title":"K., Scheurer, J., Rando, J., Freedman, R., Korbak, T., Lindner, D., Freire, P., Wang, T","venue":null,"work_id":"ccb0f04b-4e3c-4e56-99e7-5bde3503a256","year":2023},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.868127Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:6cf13521c5c9c874b0aff04e95b2bd41b83bc2636e74f16bc0258069ae8492cc","observation_id":"a7768408-fd99-484b-8b2d-e2ac559d44e5","resolution":{"observed_at":"2026-08-09T10:43:30.770751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.760636Z","title":"Rime: Robust preference-based reinforcement learning with noisy preferences","venue":null,"work_id":"df2a273e-f123-4db6-9c87-1959f4fcb0b2","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.898076Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:ab418cfdeabbb144a84c051db8a56c0abc12d0fc7a93452397cec1208f9d266d","observation_id":"75b5cb6f-ee2e-4780-97a8-8b2224c690d8","resolution":{"observed_at":"2026-08-09T10:43:30.763353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:28.923060Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.923060Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:b383213440132ce0c568412cb62e198ce34bac01ef2a5e3312da8e5c30b648c3","observation_id":"207fe773-bd59-4b53-bfcd-ff9bbe4e72fd","resolution":{"observed_at":"2026-08-09T10:43:28.923060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.749401Z","title":"Active reward learning","venue":null,"work_id":"49dc1544-e241-462b-b8aa-aedda786d893","year":2014},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:28.969360Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:e6df32920d2d939edb53dc4dd37c60f65c3bd6871b1bbb3410f07597ad4214c8","observation_id":"a90cc916-4e2f-4847-b594-6e2d1da110cf","resolution":{"observed_at":"2026-08-09T10:43:30.751851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.742503Z","title":null,"venue":null,"work_id":"75fa2c66-51e0-4211-bc21-a1ade6271725","year":2021},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.014153Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:91ef0ded802da213ed11aae826f3ca281d87ce17b052318a785c2daae03948ad","observation_id":"be4b8444-a54b-4481-9b09-616db01f7354","resolution":{"observed_at":"2026-08-09T10:43:30.744853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.040157Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.040157Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:a14a210cdcfb0c3d338ab665f87c5bbad598931c87fa8b84ec9b12b6d417bb99","observation_id":"3556975a-9c5d-4e36-a74d-37e12791b809","resolution":{"observed_at":"2026-08-09T10:43:29.040157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.087356Z","title":"Dextreme: Transfer of agile in-hand manipulation from simulation to reality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.087356Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:56ee66a8d239235a97d3c41cac0fc3fd21263bcd03a646cf4c2efeb643998f81","observation_id":"2aa62631-b756-4657-887b-66b3bdf78413","resolution":{"observed_at":"2026-08-09T10:43:29.087356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.725360Z","title":"A bound on the label complexity of agnostic active learning","venue":null,"work_id":"55598a04-22e8-46f0-b67e-d5175c654c04","year":2007},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.136280Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:861f1f7f241865f73adc4070e5c18479a8891138de8b80633d747ce0aa54452a","observation_id":"c90768d1-0497-4b55-9d14-9fc12726d149","resolution":{"observed_at":"2026-08-09T10:43:30.728172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.717945Z","title":"Contrastive preference learning: Learning from human feedback without rl","venue":null,"work_id":"3aab8792-7b2f-4178-834a-a4edfaf4ee9f","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.195602Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:c4fee5e43178feaacf8e12cdeb9da8c236a6c0fd045819a77f458087cbf2a087","observation_id":"5adef6a4-abde-478a-9fde-e2396446d4aa","resolution":{"observed_at":"2026-08-09T10:43:30.720704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.260706Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.260706Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:09c1f9739597ac3ee68162d2227e1b489bd7c56a45f6084b9eae4b1a633cf27e","observation_id":"6b157bd0-0fbf-4204-ab79-7901b94de3d3","resolution":{"observed_at":"2026-08-09T10:43:29.260706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.705623Z","title":"J., Kim, J., Kwak, M","venue":null,"work_id":"bc583912-6755-4225-81b4-c5e55455eeaf","year":2025},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.288699Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:4f2ae70299cf4ff14d090272f71e739c55b6b6589c71de1c1a928a070524c1a1","observation_id":"e2c450e8-3c25-4f76-acbf-a1854f0dce3c","resolution":{"observed_at":"2026-08-09T10:43:30.708222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.654216Z","title":"Anymal parkour: Learning agile navigation for quadrupedal robots","venue":null,"work_id":"cd7a8d92-bd44-47bc-91d2-c589354900ef","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.318392Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:48a58a8a48a76c5b8cf84f0fa787e8a2cac89d9459e4168f27da50091b5b4677","observation_id":"fd883f38-0857-4f0e-8e3e-3df5712aebd3","resolution":{"observed_at":"2026-08-09T10:43:30.700971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.599957Z","title":"Bayesian active learning for classification and preference learning","venue":null,"work_id":"dfde755f-0e27-40ea-8c83-87c7fec076d1","year":2011},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.342740Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:1749398b9c47058ed89183ed9b0c1882886176805250d2149a91e9b0ee3248d5","observation_id":"105dff5c-cca8-4fcb-98a4-0cc41fa7cc85","resolution":{"observed_at":"2026-08-09T10:43:30.623589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00541","last_updated":"2022-12-24T00:50:53Z","snapshot_observed_at":"2026-08-08T21:02:49.411549Z","submitted_at":"2022-12-01T14:47:47Z","title":"Predictive Sampling: Real-time Behaviour Synthesis with MuJoCo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00541","snapshot_observed_at":"2026-08-09T10:43:29.355325Z","title":"Predictive Sampling: Real-time Behaviour Synthesis with MuJoCo","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.355325Z"},"links":{"cited_paper":"/paper/2212.00541","citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:f8fc6a42715a7ab5c249809201a1d05bc15dffd7e0d7140f5966cccdf80e5494","observation_id":"5d47eb4f-7368-43bb-9402-13169fc760d9","resolution":{"observed_at":"2026-08-09T10:43:29.355325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.371725Z","title":"Reward learning from human preferences and demonstrations in atari","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.371725Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:9eff9c37ce5aa3f7e0aaa654deef06b3ea46de31cac7dfad815da8fcd14b2efb","observation_id":"e7c590db-5767-421d-818f-3ec92b8b7e6d","resolution":{"observed_at":"2026-08-09T10:43:29.371725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.381374Z","title":"Mentornet: Learning data-driven curriculum for very deep neural networks on corrupted labels","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.381374Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:1894b79befc586cd9800ba8f0ab74fca83e83aa1bdacb9ab99a1513e15ed7e1a","observation_id":"51bf2fa3-9ec5-44f8-ad7b-1c626319c2e4","resolution":{"observed_at":"2026-08-09T10:43:29.381374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.547914Z","title":"D., Lu, Z., and Mou, S","venue":null,"work_id":"cf613b24-f34b-44d1-a43c-bae370c37898","year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.400413Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:b95dd337fc63208a3a574717a633e7e723f5929a777bcaf7190c151544b9d64e","observation_id":"f1ba41ef-b407-40d3-aecb-2c43d8d25f0a","resolution":{"observed_at":"2026-08-09T10:43:30.561042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T10:43:29.419649Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.419649Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:23dfe55a3663eb3908f0475ac50bf9243ac2cac234a4fc6cbd57819de11df51f","observation_id":"f11811a7-a8b8-4459-aecf-fc6097ce0a29","resolution":{"observed_at":"2026-08-09T10:43:29.419649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.430378Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.430378Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:f0ec4ed1187610f03ec6517674e6bd00009427cccc02aa57181d9fb4faee241d","observation_id":"95374d00-e105-4bc7-ab63-08b4cc1eb262","resolution":{"observed_at":"2026-08-09T10:43:29.430378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.537225Z","title":"Robust inference via generative classifiers for handling noisy labels","venue":null,"work_id":"f25415b8-584f-4e0d-9183-3ce6d5e9f864","year":2019},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.433242Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:25cd331082e686d857fb581bad102a981d356aa04146ff0eba926f183754d408","observation_id":"c0cd69ee-c286-4026-8d6c-d99fc2107da2","resolution":{"observed_at":"2026-08-09T10:43:30.539682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.530584Z","title":"B-pref: Benchmarking preference-based reinforcement learning","venue":null,"work_id":"95e0ee81-e558-4d4b-aff8-423d0e586d01","year":2021},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.435489Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:ae4c617b6ebf83aa637b94d15e9d9af699a77bc334aa9664c6f056296d0bcc2c","observation_id":"d2c12e43-d28d-4bc1-83a9-02cf4b1bb1b7","resolution":{"observed_at":"2026-08-09T10:43:30.532911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.524058Z","title":"M., and Abbeel, P","venue":null,"work_id":"e8627555-eaaf-4a6f-9249-f136ac40172a","year":2021},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.438238Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:c6fae50c2cff9702b3f4641484c56510ed67218f74f260cbe800c9320819b7a6","observation_id":"a6475070-01e0-4310-81f0-89150137b3d4","resolution":{"observed_at":"2026-08-09T10:43:30.526717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15521","last_updated":"2024-09-23T20:14:12Z","snapshot_observed_at":"2026-07-06T19:20:46.575837Z","submitted_at":"2024-09-23T20:14:12Z","title":"CANDERE-COACH: Reinforcement Learning from Noisy Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15521","snapshot_observed_at":"2026-08-09T10:43:29.440352Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.440352Z"},"links":{"cited_paper":"/paper/2409.15521","citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:cb214fe743d7e4d9709d8e182416606821b34b2dba752803774df44d3b3102da","observation_id":"de70b1c5-8dd4-4ecf-a9d0-38348615a996","resolution":{"observed_at":"2026-08-09T10:43:29.440352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.517391Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":"a331f991-a3fd-45c1-879f-cc16f405eb84","year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.443382Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:e4dd5da2c047e07c39296b39e1726a1bbf184edf985f4ae5d88581161ad3500d","observation_id":"1633ce63-34da-4a49-ba0a-f9916dd8ea40","resolution":{"observed_at":"2026-08-09T10:43:30.520002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.510253Z","title":"Meta-reward-net: Implicitly differentiable reward learning for preference-based reinforcement learning","venue":null,"work_id":"43667576-21c2-4493-a21a-ab886b8ef5cd","year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.446214Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:02ac27b450379ef53445d6315601896819c7b1d2c99c4a0f984ad05a0a9b1fc6","observation_id":"0b241ae0-1068-414b-835b-ce3093103431","resolution":{"observed_at":"2026-08-09T10:43:30.513205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.502527Z","title":"Does label smoothing mitigate label noise? In International Conference on Machine Learning, pp.\\ 6448--6458","venue":null,"work_id":"46cf3e24-08fd-4e56-8652-5967e6b60636","year":2020},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.448711Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:f28c1d1ecd6c7a4a56ccc4bf5a9150b4eb835ed30f8c39cfac4045d33214c84d","observation_id":"2a36d83c-1c8c-489b-8898-e4c8d06a4d8d","resolution":{"observed_at":"2026-08-09T10:43:30.505542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.495171Z","title":"Normalized loss functions for deep learning with noisy labels","venue":null,"work_id":"8fd2551a-678f-42e5-969d-89b075b4f80a","year":2020},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.451264Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:c6b202b6ea3585ad953ecdeed77cb772ff22112aba8b8917136ef710c3b313b5","observation_id":"600468a7-b4e1-4554-96fe-91d8ec0893ec","resolution":{"observed_at":"2026-08-09T10:43:30.497933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.487391Z","title":"Learning multimodal rewards from rankings","venue":null,"work_id":"62c477e8-8116-49e1-829f-0b4b0e7a9af0","year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.453805Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:1f8ad4b2a789b7b52316355121270766d3502eec751210ca56286bba89d07c47","observation_id":"e173d207-2496-40bd-83f0-81aaf3a58a02","resolution":{"observed_at":"2026-08-09T10:43:30.490607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.456719Z","title":"Active reward learning from online preferences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.456719Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:fb72e844577e9257e3e376287ec6a3654a8c9177551e7d9c1f46c75af9491236","observation_id":"329a7e06-693f-481f-92dd-b8ffa2be7630","resolution":{"observed_at":"2026-08-09T10:43:29.456719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-08-09T22:09:47.933929Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-08-09T10:43:29.459491Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.459491Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:66906e3e4c6c3d6e621e803ef359f830ed002d0e9a391419619d5dbdf041032a","observation_id":"d982223b-d224-4711-af23-c842965d9327","resolution":{"observed_at":"2026-08-09T10:43:29.459491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.423599Z","title":"In-hand object rotation via rapid motor adaptation","venue":null,"work_id":"fbe1578d-f4f8-432f-9997-ce3b6c241c41","year":2023},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.462261Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:c7ba5938fb187848f2b7540ee090aa731b5bb44c64d18e9755b4dc53434c2ed3","observation_id":"b803d692-1b8f-4421-96ca-b7c9ab70b817","resolution":{"observed_at":"2026-08-09T10:43:30.454283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.376627Z","title":"Real-world humanoid locomotion with reinforcement learning","venue":null,"work_id":"c973810b-a3c1-4f1e-bbff-0f09bc21ee68","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.464334Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:c8f9a274b69006e18480d145dea2c478b5af00945965326c8b2430b5731b87c4","observation_id":"493d9cf1-8e79-4aeb-9717-1b5d1dee2469","resolution":{"observed_at":"2026-08-09T10:43:30.379298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.369723Z","title":"D., Sastry, S","venue":null,"work_id":"4c510658-4c3a-43b9-8564-3c3ca9832cd5","year":2017},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.467115Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:e9bfccc247891280bcb20a4c9cfecb79ff8c11b34f6b23f465ca628be514794c","observation_id":"fa30657b-5875-447a-b850-6f022d688130","resolution":{"observed_at":"2026-08-09T10:43:30.372186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.362571Z","title":"Active Learning","venue":null,"work_id":"75fd9ee1-a9fe-4782-90de-2e8f7b229faa","year":2012},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.469869Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:3e1d626012427a7874a7f5a8570b813bbec97c18d4d3a7727934fe47793bd1a6","observation_id":"98783067-ef83-449d-8754-5ff5bceaee6c","resolution":{"observed_at":"2026-08-09T10:43:30.365180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.355443Z","title":"and Joachims, T","venue":null,"work_id":"e5ecfb83-9798-4a5c-be04-d5a33a1dfd3f","year":2015},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.472562Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:e1dec1b40ff059085527e73afd8de0da9dfb8a69833f139503982827d658de35","observation_id":"84607223-87fc-4817-aced-ef6d4cecf125","resolution":{"observed_at":"2026-08-09T10:43:30.358134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.505481Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.505481Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:f09e46367c485aff6dc2d634d2eb5baf20d4afbed75ea0d6958d90bb258e2a9e","observation_id":"65af65c1-3e78-4ed1-8d39-e699357bd6dd","resolution":{"observed_at":"2026-08-09T10:43:29.505481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.347769Z","title":"Deepgait: Planning and control of quadrupedal gaits using deep reinforcement learning","venue":null,"work_id":"db267220-0666-4645-8076-a2f5d0dc4300","year":2020},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.531962Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:be85bb0a15cb80b340ba5eea877dbcf5a8d7fcdfb1c0087418b06d4e2e02eb5b","observation_id":"8c461b5e-e3bc-4537-af70-750e50c71fb1","resolution":{"observed_at":"2026-08-09T10:43:30.350777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.340171Z","title":"Statistical learning theory","venue":null,"work_id":"00e0bff0-b1e7-49d8-82f1-e08e476d356f","year":1998},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.563927Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:58bb63c192a748f4a897bb034aa2731447374e4ae8489791a0af5b066bc591d8","observation_id":"7b5061c5-85a9-4756-8663-a7dbaf852d99","resolution":{"observed_at":"2026-08-09T10:43:30.342935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01149","last_updated":"2015-10-28T13:23:51Z","snapshot_observed_at":"2026-07-06T04:28:42.916691Z","submitted_at":"2015-09-03T16:18:30Z","title":"Model Predictive Path Integral Control using Covariance Variable Importance Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01149","snapshot_observed_at":"2026-08-09T10:43:29.626321Z","title":"Model predictive path integral control using covariance variable importance sampling","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.626321Z"},"links":{"cited_paper":"/paper/1509.01149","citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:9d54257b598bf64e33bfee7f016f0eb08bbfeff9ae30581c08d9f27e51eaa27c","observation_id":"d9eaba56-96bd-4b1e-b4da-63c707eb2255","resolution":{"observed_at":"2026-08-09T10:43:29.626321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.688311Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.688311Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:f234293f887d4ddad7c03f269d90bd3f3bad7dc721892dfacebc2e16d204000d","observation_id":"d612c389-17e6-488a-ad68-bcbbcbb6b901","resolution":{"observed_at":"2026-08-09T10:43:29.688311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.04216","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.040803Z","title":"J., and Jin, W","venue":null,"work_id":"7e9fc3a2-6cbf-4989-8571-b8a01c6a2747","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.751931Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:74f3feb6415f6f178ef51a5f93fd49f7e5e8648613dd28a6ac83e419f6fed42b","observation_id":"6c84d1ad-ae80-4237-bf06-93a289dd362a","resolution":{"observed_at":"2026-08-09T10:43:30.044746Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2024/586","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.956655Z","title":"Reinforcement learning from diverse human preferences","venue":null,"work_id":"1a31c2fb-f4a2-4c5e-a2b3-cd8bcaa0f584","year":2024},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.803585Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:bbc30c5cafd40bb65cbd58cc4bbe1b4cdc8c2fa39e8828ccff753d22ec6c1a29","observation_id":"98541519-e0c2-4f32-bf4e-d08c7828c5eb","resolution":{"observed_at":"2026-08-09T10:43:29.960746Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.328656Z","title":"W., Zhang, Y., Sun, J., Zhang, C., and Zhang, R","venue":null,"work_id":"8e1bc195-e35e-4e59-96a4-612241e523bb","year":1909},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.861494Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:c1e9d43d3a7ef205e7b1c493ff25dd6205f6300c7cdeb13dd92d37e464de3921","observation_id":"222d7e08-795e-4030-a439-79181c413d65","resolution":{"observed_at":"2026-08-09T10:43:30.331409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.320839Z","title":"Rotating without seeing: Towards in-hand dexterity through touch","venue":null,"work_id":"7f02ae03-a3bb-4832-81f5-c23b13517783","year":2023},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.906482Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:e2666ddb14e7914cefd61b4a08a4461aa6666fee29a965225c2398b98619b9d3","observation_id":"612708e9-1ebf-4201-a4a4-50eba0878a15","resolution":{"observed_at":"2026-08-09T10:43:30.323771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.313174Z","title":"Uni-rlhf: Universal platform and benchmark suite for reinforcement learning with diverse human feedback","venue":null,"work_id":"211ef0c3-f496-4e54-911c-1cfe74e39ae6","year":null},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.924836Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:99716af90a50680b00cfde2145444824cf9abc79c9ee89e257a4955faf1d0e3d","observation_id":"4b58ab11-be9c-4095-98f7-ebb51bfb6c50","resolution":{"observed_at":"2026-08-09T10:43:30.316013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.289658Z","title":"N., and Lopez-Paz, D","venue":null,"work_id":"5b83be47-0908-464a-8a53-a6a66adc1b7e","year":2018},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.929348Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:15e40eadc3a1fc597cbaec4bf3fdfea5451ea218dd689232d6ad090303479d9f","observation_id":"cf8037f1-49f0-45ea-9177-7b698dfb0fcc","resolution":{"observed_at":"2026-08-09T10:43:30.308089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.931811Z","title":"Robust curriculum learning: from clean label detection to noisy label self-correction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.931811Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:fa407412cd357a1ebaa4c6a030e63d14c61df7afa59c6d1e0ad232b05d84f525","observation_id":"3f602393-683b-4a46-b1c6-a2c40e78eaca","resolution":{"observed_at":"2026-08-09T10:43:29.931811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:30.203650Z","title":"A., Atkeson, C","venue":null,"work_id":"d666b7bf-88ff-43a4-b89f-41411fadf2d1","year":2010},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.933967Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:20b8495d04c9c5d8b71f9436193f7ca2751e7dcff49de8752e798bcd2ba3c21c","observation_id":"306be71d-1d9d-4666-9187-3a028e1bf514","resolution":{"observed_at":"2026-08-09T10:43:30.257401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:43:29.936815Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T10:43:29.936815Z"},"links":{"citing_paper":"/paper/2502.02921"},"observation_digest":"sha256:a5b9f4446237fde403449341ae4d36f2227eb2cbcfd3da5b4bca552fad81aa94","observation_id":"cfd5d2b2-3fdc-41af-b6ed-da0903ac5905","resolution":{"observed_at":"2026-08-09T10:43:29.936815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02921","last_updated":"2025-05-28T04:40:46Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:19:07.773070Z","submitted_at":"2025-02-05T06:30:14Z","title":"Robust Reward Alignment via Hypothesis Space Batch Cutting"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2502.02921."}