{"as_of":"2026-08-08T17:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28ae6e382fd60ebd5d7a304e506dc2fe368083dc1f8dd2f9125a886ac8df47c2","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:33:04.401624Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13741/citation-record","integrity":"/paper/2506.13741/integrity","json":"/paper/2506.13741/citation-record.json","paper":"/paper/2506.13741"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2008.12340","last_updated":"2020-08-27T19:08:30Z","snapshot_observed_at":"2026-08-07T03:12:50.358736Z","submitted_at":"2020-08-27T19:08:30Z","title":"Forecasting with Multiple Seasonality","version":1},"cited_work":{"arxiv_id":"2008.12340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.12340","snapshot_observed_at":"2026-08-07T00:33:04.539654Z","title":"Forecasting with Multiple Seasonality","venue":"cs.LG","work_id":"304e563b-60bc-4d95-b92a-0903c68ef109","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.096688Z"},"links":{"cited_paper":"/paper/2008.12340","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:8fffecab8dba80619893cd8366d8397ea4e3985d87aedba7f6200dfad082aa82","observation_id":"0d3ca3b8-39bc-4df9-9bda-4faae0bb9f96","resolution":{"observed_at":"2026-08-07T00:33:04.542813Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.766595Z","title":"Batch active preference-based learning of reward functions","venue":null,"work_id":"230e0cbb-7054-4100-a813-c01738c88842","year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.165524Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:dedb22bb5c74c4912372ff1659d387e16147274ea558eba395d80c543b8b87a7","observation_id":"0ff5fe61-f701-4d0e-98cf-f78aa95601dc","resolution":{"observed_at":"2026-08-07T00:33:04.769359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.757928Z","title":"Landolfi, Dylan P","venue":null,"work_id":"ed667b85-9e6f-4723-9b17-ba569645c3a2","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.194615Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:b0cc013d4b4a0a791409dc20f56b9bbb9dd0a11d0fdc2f2879586f7d39c190ad","observation_id":"3ca188d0-d1aa-4191-bee9-ae299a861ddf","resolution":{"observed_at":"2026-08-07T00:33:04.761093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:02.271354Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.271354Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:94c9f3e390a83b4e26443c1be4fff60671840a200d247b243199a44a182a4835","observation_id":"16f14e3a-6d11-45d0-a1a3-9dbcc885d1ff","resolution":{"observed_at":"2026-08-07T00:33:02.271354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.744218Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"bcf02ed6-2226-4cb7-8b14-98d1c2605421","year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.342628Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:4c47e7d419b421b826c2256494772925bbb85cc625cf5e7e7a9527b574186837","observation_id":"bb8ca152-c1ee-466f-8552-22153d40bb14","resolution":{"observed_at":"2026-08-07T00:33:04.747117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.735539Z","title":"Autonomous skill discovery with quality-diversity and unsupervised descriptors","venue":null,"work_id":"f444b290-c455-4151-b511-076d04b58624","year":2019},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.370760Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:5452515f4890ead6e8cf58b99b76d1de38aa22838477862df5ebe925d8a65827","observation_id":"75ee63ad-1625-4f68-87ca-0306261e0258","resolution":{"observed_at":"2026-08-07T00:33:04.738394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13800","last_updated":"2021-09-28T15:30:55Z","snapshot_observed_at":"2026-08-07T16:36:41.078725Z","submitted_at":"2021-09-28T15:30:55Z","title":"Faster Improvement Rate Population Based Training","version":1},"cited_work":{"arxiv_id":"2109.13800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13800","snapshot_observed_at":"2026-08-07T00:33:04.525904Z","title":"Faster Improvement Rate Population Based Training","venue":"cs.NE","work_id":"e27cad6b-acd6-4da7-bdae-2fb0d8aad262","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.441449Z"},"links":{"cited_paper":"/paper/2109.13800","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:b62ec0c328283077c99d622a7bf52c0a7d9fb8ef246ee480bc31534ad30cd58b","observation_id":"ee5644ab-4798-4701-ab72-26e93eb93764","resolution":{"observed_at":"2026-08-07T00:33:04.530615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.727222Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"d5960e3f-617c-4e1b-81e7-039d98988ff9","year":2019},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.502883Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:71af59657143a16a830b22032551ebf216c533752e0d43a395a31b20245e2faa","observation_id":"98854a81-2221-4aef-b8d9-d1f072050231","resolution":{"observed_at":"2026-08-07T00:33:04.730037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.718553Z","title":"Jax-lob: A gpu-accelerated limit order book simulator to unlock large scale reinforcement learning for trading","venue":null,"work_id":"a9c6cb20-defc-4ecf-b1a5-91ea76029705","year":2023},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.566117Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:f479034651c10ae514b332c14b743dd5ea8d8548aa94eafa4a928cd0301a8439","observation_id":"8b8647fa-d609-449b-9991-3b6ff6253b6e","resolution":{"observed_at":"2026-08-07T00:33:04.721729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:02.622234Z","title":"u rnkranz, Eyke H \\","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.622234Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:f40a11059c10fd91820ffa355012644513770bfdd439ff4fdfa51eb380eee4ec","observation_id":"7018460c-2e08-436c-9e75-6936fccb3a54","resolution":{"observed_at":"2026-08-07T00:33:02.622234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T00:33:02.685817Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.685817Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:ed156775cb2a7aacc4004276a6dacc4fb63eb1612e3591678c6b57ef4d657ebc","observation_id":"845db6e5-ee25-43ac-98cb-4ebbacc3c51d","resolution":{"observed_at":"2026-08-07T00:33:02.685817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.705116Z","title":"Russell, and Anca D","venue":null,"work_id":"28d4d7ea-7396-45d9-b1f3-ae23b1f77f74","year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.753777Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:4ccbd1b760ef26d4e65d6f2cc0863312ae1fb0d9b0b60ce77b69fb63eb56436a","observation_id":"20f8516b-548f-49ce-b3b0-246b310d433a","resolution":{"observed_at":"2026-08-07T00:33:04.707679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.695164Z","title":"Query-policy misalignment in preference-based reinforcement learning","venue":null,"work_id":"4a800fd3-3991-4738-99d7-ed8b49a4d4f3","year":2024},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.789081Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:961ca1e7444d88938acc2c6d2dcd524e4ff1169e249a2231a9de54a58fb91a95","observation_id":"2dc743d1-2a3b-46ca-9edf-4d6bdf6d34c9","resolution":{"observed_at":"2026-08-07T00:33:04.698293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06079","last_updated":"2025-05-09T14:22:43Z","snapshot_observed_at":"2026-08-07T15:48:26.404805Z","submitted_at":"2025-05-09T14:22:43Z","title":"TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06079","snapshot_observed_at":"2026-08-07T00:33:02.820968Z","title":"Trend: Tri-teaching for robust preference-based reinforcement learning with demonstrations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.820968Z"},"links":{"cited_paper":"/paper/2505.06079","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:db304ae4fe5ff3efabf15efbfb19cb484844ddc1293c14434f5a8f1e1b71af4a","observation_id":"b34a91bc-ede1-4ca6-9fce-25bd053e69b7","resolution":{"observed_at":"2026-08-07T00:33:02.820968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09846","last_updated":"2017-11-28T16:16:21Z","snapshot_observed_at":"2026-07-06T06:11:24.949724Z","submitted_at":"2017-11-27T17:33:27Z","title":"Population Based Training of Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09846","snapshot_observed_at":"2026-08-07T00:33:02.870174Z","title":"Czarnecki, Jeff Donahue, Ali Razavi, Oriol Vinyals, Tim Green, Iain Dunning, Karen Simonyan, Chrisantha Fernando, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.870174Z"},"links":{"cited_paper":"/paper/1711.09846","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:847724d5aafe7d13ad5bcbcb7b29b3e9807a65c81da18f8014828dd174e2227d","observation_id":"fc53ef44-60ad-4df3-ad40-b688b6a136cd","resolution":{"observed_at":"2026-08-07T00:33:02.870174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.687037Z","title":"One solution is not all you need: Few-shot extrapolation via structured maxent rl","venue":null,"work_id":"260d8b5d-9691-4350-8378-61961b1fd4ff","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.922990Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:0b21ddccf811ee75705bfd126c433d4eb53421fc5e7d59fa8c2e5603d91c790d","observation_id":"4a483ab6-d007-40f8-8f9b-c6b3a0bf95af","resolution":{"observed_at":"2026-08-07T00:33:04.689812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.679446Z","title":"B-pref: Benchmarking preference-based reinforcement learning","venue":null,"work_id":"0e69fb24-b1e6-482a-b9f7-62e7d9d21c79","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:02.965011Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:8bdd11c11f8f8bf70ba8672e88a85571fcba44fc459bc354dd14f26ea7f0aadc","observation_id":"b0a333ab-5437-4079-b7de-e88058b5fd29","resolution":{"observed_at":"2026-08-07T00:33:04.682059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.671714Z","title":"Smith, and Pieter Abbeel","venue":null,"work_id":"a961c52b-0730-45ff-8def-71f2f4476fd2","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.009880Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:a7b4b566329c606cfde5a8707513bfcf812035233c28da5b11c58f4cd25cab82","observation_id":"dea18995-5bd0-4844-b2e9-15ef7185ed2b","resolution":{"observed_at":"2026-08-07T00:33:04.674287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.664341Z","title":"Evolution through the search for novelty","venue":null,"work_id":"3283b821-ca97-495a-9c0b-4ace1bccf58f","year":2012},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.076339Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:0c5ccfb4935f45bd42a06a0d473f1800ca32e55308ebf9533031a3668a7aed7b","observation_id":"22081c72-68ed-4432-befd-c43cfb4912b9","resolution":{"observed_at":"2026-08-07T00:33:04.666897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.656455Z","title":"Evolving a diversity of virtual creatures through novelty search and local competition","venue":null,"work_id":"fb32d908-9ccf-4351-95ee-628f04763e41","year":2011},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.161033Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:a1280f9f441a8149b3cd3a0cfbc2563600d91a5472f1220227895e11ba1d1014","observation_id":"7394ec4d-2201-40c3-adc0-e427cf205823","resolution":{"observed_at":"2026-08-07T00:33:04.659279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.648216Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":"5f376495-92f3-4e57-9bf1-8599ca20fa36","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.215678Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:9904a36af7325619c62c51989e7a7af9610232b9daa48f4c4557d83c9b8c331a","observation_id":"8f765897-1cd7-4aa4-b3e0-3abdf2ead841","resolution":{"observed_at":"2026-08-07T00:33:04.651000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.640097Z","title":"Meta-reward-net: Implicitly differentiable reward learning for preference-based reinforcement learning","venue":null,"work_id":"09573bac-4c50-43cd-bdb3-5db357d58ef2","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.280078Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:7ffed65ef51cdb33c903384a913e225317ca77966ee5ceb7c52db5868ad30cf1","observation_id":"d7e0be92-746a-4f3c-b441-eb77449568ab","resolution":{"observed_at":"2026-08-07T00:33:04.643003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.631878Z","title":"Efficient preference-based reinforcement learning using learned dynamics models","venue":null,"work_id":"9dc2e7e7-ce18-4740-8f42-d94c557d0807","year":2023},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.339377Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:9d90b41c69a76990f773190fdf65dfd352f0b3ef094ee518316e0b97e42401d3","observation_id":"8b9e4ef6-97bd-43a6-9945-99b25d8274ca","resolution":{"observed_at":"2026-08-07T00:33:04.634836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.623914Z","title":"Variquery: Vae segment-based active learning for query selection in preference-based reinforcement learning","venue":null,"work_id":"a4879930-f166-47e0-9764-604d0458ea6a","year":2023},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.389931Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:c05d417e10f41a3a32e712a7e4700dd5bb23fe96f1aca83f24fffd12028a9b1d","observation_id":"6856a5f5-707d-44d1-863e-9b9c6e4b3f86","resolution":{"observed_at":"2026-08-07T00:33:04.626755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06527","last_updated":"2022-11-12T00:34:41Z","snapshot_observed_at":"2026-08-01T06:10:34.804066Z","submitted_at":"2022-11-12T00:34:41Z","title":"Rewards Encoding Environment Dynamics Improves Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06527","snapshot_observed_at":"2026-08-07T00:33:03.458839Z","title":"Rewards encoding environment dynamics improves preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.458839Z"},"links":{"cited_paper":"/paper/2211.06527","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:fd1699c8a88ebb7a381d7b559cdc497ed56218aa047ab19b9d2a5f107763ef64","observation_id":"5e0af0b1-3115-40a0-80bb-045cb1e8d4b5","resolution":{"observed_at":"2026-08-07T00:33:03.458839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.04909","last_updated":"2015-04-20T01:17:00Z","snapshot_observed_at":"2026-07-06T04:15:24.342522Z","submitted_at":"2015-04-20T01:17:00Z","title":"Illuminating search spaces by mapping elites","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.04909","snapshot_observed_at":"2026-08-07T00:33:03.520942Z","title":"Illuminating search spaces by mapping elites","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.520942Z"},"links":{"cited_paper":"/paper/1504.04909","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:10151958d7eeed4ed42e2b6887f10452589457c023a0513751f92d541fa7dda1","observation_id":"10ecdd6d-fdf7-4749-a094-8816e6e2010b","resolution":{"observed_at":"2026-08-07T00:33:03.520942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.614765Z","title":"Xland-minigrid: Scalable meta-reinforcement learning environments in jax","venue":null,"work_id":"50be7d59-d1a4-4bc3-ad87-d55b8a0d01a0","year":2024},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.600291Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:192d6ab0de50ddace0c863eef20a74099a4f47df13006deb470b75cc247260bc","observation_id":"cf25001d-17db-4534-a18f-7a5581b6f219","resolution":{"observed_at":"2026-08-07T00:33:04.618180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.606168Z","title":"Policy gradient assisted MAP-Elites","venue":null,"work_id":"eedc69bb-9482-4f03-86d7-ccec2185ba98","year":2021},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.650089Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:7eb44ce852b48aabd887fe23a5ffd8af73998dbf8dacc2a9e41d3ac610d357c1","observation_id":"6f73c65c-9e1d-49c8-be74-979b7d1236bb","resolution":{"observed_at":"2026-08-07T00:33:04.608896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.597895Z","title":"Discovering diverse solutions in deep reinforcement learning by maximizing state--action-based mutual information","venue":null,"work_id":"74c0774b-c54c-4923-b9ad-2ffb143fdf94","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.732003Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:c12793158f93f84c3e7cbdded790bcbd369c68d2be4ebf7d2e901fbc253093b0","observation_id":"a166f64c-c237-412e-972a-f1dbb3340dce","resolution":{"observed_at":"2026-08-07T00:33:04.600764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-07-06T12:49:40.338344Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-08-07T00:33:03.800435Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.800435Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:a5c0354bd103cc1d31e81c7cdb1fbef9086b0166642b048f1761e7113d507f05","observation_id":"c0ed7339-82d8-44be-a7b7-a506a191fd40","resolution":{"observed_at":"2026-08-07T00:33:03.800435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.589511Z","title":"Effective diversity in population based reinforcement learning","venue":null,"work_id":"82ddd6c5-0b5f-4f45-8ba5-6d323df6befa","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.883178Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:0da884785df71ea8a1e4004c6d375cd10857748b72600a2a480fd9e8662b410b","observation_id":"47273825-0496-4a5f-87f8-5a271a79c99c","resolution":{"observed_at":"2026-08-07T00:33:04.592571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.580572Z","title":"Jaxmarl: Multi-agent rl environments in jax","venue":null,"work_id":"112a9c5f-d692-4720-8afb-f0a356ab83b9","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:03.948814Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:8fbce8241db44a00ced110628beb605f9dd3a9e39b6adafbfafd10a30e264842","observation_id":"4d3691d9-59db-49ee-868b-4f9f7203e226","resolution":{"observed_at":"2026-08-07T00:33:04.583969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-07T00:33:04.015747Z","title":"Evolution strategies as a scalable alternative to reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.015747Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:a23f6adeadcbca561e8eb78c75652033a2f6b4fc1efcb6684ef602deb73bd7e9","observation_id":"cba07e3f-6afc-47cc-8173-ad5d6961a15d","resolution":{"observed_at":"2026-08-07T00:33:04.015747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.571953Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":"067e3fcb-c6f9-4f50-b3fa-c38ba1f29c45","year":2020},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.098928Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:9460e5e14b2d6bc607d8c3dc418e91260be04d9845718c47a5eef974a25c3e48","observation_id":"e602c915-ec49-4297-8476-52b38f3e57eb","resolution":{"observed_at":"2026-08-07T00:33:04.575052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.163238Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.163238Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:72d361b6955dd968d5455c307578ca9804abea5e93777c4ce0aeb5b142cbab77","observation_id":"100cb00e-0586-444b-b90d-34a2793461b6","resolution":{"observed_at":"2026-08-07T00:33:04.163238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:33:04.252878Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.252878Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:615d3482c2c96a586a91348efcdd689e91a89e54d11b92dfe0954d18ce747080","observation_id":"8ea88ba8-32ca-403b-9456-f0b60699cb2d","resolution":{"observed_at":"2026-08-07T00:33:04.252878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.557691Z","title":"Ball, Vu Nguyen, Binxin Ru, and Michael A","venue":null,"work_id":"e6c1cce0-009a-457f-917a-4e42a19ba0b2","year":2022},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.332746Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:1caaa75323503c969c0a043157a2959930dad137328c17bbbb839c7fa19975cf","observation_id":"c6be78c0-e1dc-45bd-92cf-e897ea2f2946","resolution":{"observed_at":"2026-08-07T00:33:04.560627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:04.548815Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":"92677260-f4e6-48be-a05e-2a2fb7a44ca1","year":2017},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.401624Z"},"links":{"citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:bb30f28b04f3b6fdaa79daaf60e8e973eba2d37a8387d849bfe0de9133bce3b8","observation_id":"1591528d-92f0-4345-a103-0f26b8bbe050","resolution":{"observed_at":"2026-08-07T00:33:04.552166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T03:12:53.049798Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.13741."}