{"as_of":"2026-08-08T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1c243b2ab3ca4265e2e9f1fae130b8e2979c844525bee7814f51e6699634175","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:17:35.918503Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.14066/citation-record","integrity":"/paper/2507.14066/integrity","json":"/paper/2507.14066/citation-record.json","paper":"/paper/2507.14066"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.325207Z","title":"A survey on modeling and optimizing multi-objective systems,","venue":null,"work_id":"f787d5f7-c873-4477-bdf1-7b93cb19a8fe","year":1901},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:32.960135Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:d595036a8996a9bb156177a05afaeae2299e943237e97af1780ecd26af669c23","observation_id":"9fc1a82f-f4fb-4255-be81-4d7da518b296","resolution":{"observed_at":"2026-08-06T16:17:36.328027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.318104Z","title":"Active learning with fairness-aware clustering for fair classification considering multiple sensitive attributes,","venue":null,"work_id":"5abe4afd-2a74-48c5-86dc-b942b7a5408b","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:33.086379Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:6c63a2785b719cbd2b3d93143376637d2b6bd6a27dd4d4fcc800ae1ce566962f","observation_id":"ae06a308-6755-455b-a074-e2e0c3686134","resolution":{"observed_at":"2026-08-06T16:17:36.320638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.310676Z","title":"Constrained ordinal opti- mization—a feasibility model based approach,","venue":null,"work_id":"5e9812e5-e11c-417c-83f1-5d0e76900862","year":2006},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:33.158951Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:55df1987120d291660e6089ad7f135461edcc7716b1f60c875943283552e388a","observation_id":"0c8692a9-07b7-45d4-b321-303a35428fbd","resolution":{"observed_at":"2026-08-06T16:17:36.313585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.303310Z","title":"Reliability/cost-based multi-objective pareto optimal design of stand- alone wind/pv/fc generation microgrid system,","venue":null,"work_id":"d4a8b942-4aae-4672-864f-d168272b1382","year":2016},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:33.319524Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:3b6a7575ccaa35aaf880311ebe6e3a8a62905637d1264a548008fc700bd58af9","observation_id":"c696ac33-1444-4b15-8189-5e10c27456d2","resolution":{"observed_at":"2026-08-06T16:17:36.306194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.295147Z","title":"Toward personalized decision making for autonomous vehicles: a constrained multi-objective reinforcement learning tech- nique,","venue":null,"work_id":"1792992b-48c0-45e6-b21c-6bab5c90631d","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:33.469179Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:1f153ec294500d519e29d9cbbb8ddd4dc1b86ae18daaf0a409d86f6b51ade290","observation_id":"2d48f134-df5b-413c-a3aa-0c3ee75c410e","resolution":{"observed_at":"2026-08-06T16:17:36.298042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.287461Z","title":"B-pref: Benchmarking preference-based reinforcement learning,","venue":null,"work_id":"6668c27b-2178-494d-aff0-037aff82df16","year":2021},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:33.685131Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:543e6951e761d6cd25894b978f8879fc14d0f6ff099708b3760dae58e65e4abb","observation_id":"716eb782-3d6c-4a6c-8ed9-1be6e67e00ff","resolution":{"observed_at":"2026-08-06T16:17:36.290058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.280110Z","title":"Self- supervised online reward shaping in sparse-reward environments,","venue":null,"work_id":"0e2e7dc0-3735-4490-b0a7-57fbc89d62b1","year":2021},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:33.851165Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:7c7da4847fbf6c873d2fb2c010fa11e107c97f6254cf995167ea3c6fc39fd0c8","observation_id":"9e9b1cfd-c2d6-4a14-9fc6-cbd0d5bc2d51","resolution":{"observed_at":"2026-08-06T16:17:36.282576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.272491Z","title":"Reward shaping for knowledge-based multi-objective multi-agent reinforcement learning,","venue":null,"work_id":"ca777d02-284a-4cc5-9795-9bdf23d1de77","year":2018},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.081232Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:ffe510b368c496971d53c1628e766766ac88874815d21515045c7c1578c6aa62","observation_id":"13ceb81f-37c5-41c2-83c9-72311c454326","resolution":{"observed_at":"2026-08-06T16:17:36.275241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.265226Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsuper- vised pre-training,","venue":null,"work_id":"ac4748a4-d527-4ccd-813b-c5aaa442bfcb","year":2021},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.340535Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:7e481267b9b000bda05e4a3df2c59b00612c86a47a6b64a0e87aeefc5c7ba787","observation_id":"a2583ef5-ca33-4e10-82ce-64ef063c2802","resolution":{"observed_at":"2026-08-06T16:17:36.267833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.257487Z","title":"Reinforcement learning and the reward engineering princi- ple,","venue":null,"work_id":"d1d6705b-4900-4b0a-8ac4-5e574986c9a1","year":2014},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.526104Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:7a65eb9a2664f2d95d9fd907eac47c989fa8321f81f83b0d0c6a66c338698b3d","observation_id":"4537b1db-9c38-4270-ae4b-71a51d79da40","resolution":{"observed_at":"2026-08-06T16:17:36.260407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:34.529527Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.529527Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:3432fe208c4819f28c03ed379290575a9b01afa7153f927f9dc35dd533dc51a4","observation_id":"24ca2cd7-5064-40f5-99ea-12b31bbaef82","resolution":{"observed_at":"2026-08-06T16:17:34.529527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.245136Z","title":"A bayesian approach for policy learning from trajectory preference queries,","venue":null,"work_id":"624fc5cd-d218-4b10-8776-3283c853b1b1","year":2012},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.569067Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:be6347ace244066179697e2e31e9c72b47e510fe71400d1249685caaf870e205","observation_id":"b220a6de-e529-44a7-a136-6f85cbaf7a7f","resolution":{"observed_at":"2026-08-06T16:17:36.247729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:34.641984Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.641984Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:1652d906fe2496be561cb515ef010b4a440df2856ec41c8cd9baf4efd60519b0","observation_id":"5e73303c-0400-4634-b2d6-680945ac21e7","resolution":{"observed_at":"2026-08-06T16:17:34.641984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T16:17:34.803156Z","title":"Playing atari with deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.803156Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:049e54b164c653fec7d5b294a2114c245e6c3e3bb164601bdeae92ac95d91728","observation_id":"59e50602-f0f1-4bc3-8a65-75e1f0d8e058","resolution":{"observed_at":"2026-08-06T16:17:34.803156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.232931Z","title":"E-mapp: Efficient multi-agent reinforcement learning with parallel program guidance,","venue":null,"work_id":"6dbaa063-c52b-4147-a3f9-200f9a634aac","year":2022},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.908704Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:a35ca6cfeb1e89795426296517fc9e21d4039d837181291ead3c4a44f11407c3","observation_id":"45c39390-16cf-419b-8bc3-0cf91b5b9b7f","resolution":{"observed_at":"2026-08-06T16:17:36.235748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:34.990348Z","title":"Mastering the game of go without human knowledge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:34.990348Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:72b9ee4a803598c8a293441a53b7a49797b03700a554eee9fae1962dd3f75b65","observation_id":"188d3ba9-859c-4067-93ac-7c801054fb7e","resolution":{"observed_at":"2026-08-06T16:17:34.990348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.220665Z","title":"Simplify twin crane scheduling in railway yard by spatial task assignment,","venue":null,"work_id":"0e11c17c-b2a2-426e-87e3-0ab556df61a8","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.073240Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:89f6e9ac31de84b63c4556cc49ac0bb9f640a6a9a78222677c963af8604789b0","observation_id":"191fe72d-0e3f-4e18-92d0-ca2e6acdd8a8","resolution":{"observed_at":"2026-08-06T16:17:36.223250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.212927Z","title":"Large-scale data center cooling control via sample-efficient reinforcement learning,","venue":null,"work_id":"78e1e4e9-f4d6-4ea9-b397-d93ebc609ea2","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.159987Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:aaaa52bff598d275c88e89ebb173ac901cdda80e7a9eff269213864019f9bf14","observation_id":"b5bb24a4-fef6-4148-a288-c2e0654dcf78","resolution":{"observed_at":"2026-08-06T16:17:36.215576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.205416Z","title":"An efficient real- time railway container yard management method based on partial de- coupling,","venue":null,"work_id":"4150071c-012c-4a77-b9d6-c01384847130","year":2025},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.240063Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:731c6fa1dd83315cc73f9482c786921349e347e23b5a4f381ba0ccb4e5816c1a","observation_id":"a82b67cb-516f-4951-92b1-4de16f88d1de","resolution":{"observed_at":"2026-08-06T16:17:36.208046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.197922Z","title":"Integrating mechanism and data: Rein- forcement learning based on multi-fidelity model for data center cooling control,","venue":null,"work_id":"b08a5045-7da6-4172-a928-11ab88a39b00","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.322733Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:ba61ff325c848dd7dfbfe3b55c8512a1d7ddfcc3a83958001e10b1d930040275","observation_id":"97ff2a81-6704-405c-af47-15839da3abfc","resolution":{"observed_at":"2026-08-06T16:17:36.200746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.189553Z","title":"Incentive-oriented power-carbon emissions trading-tradable green certificate integrated market mecha- nisms using multi-agent deep reinforcement learning,","venue":null,"work_id":"ae640b7b-ebaf-4c10-ac58-8b893b0aa550","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.382374Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:8e0ee47de271fe134bba9e02fb8137634ad74666c741e9053e17cfffce2c44ba","observation_id":"1dffd4ba-39e9-4fea-b1e1-816f02af9399","resolution":{"observed_at":"2026-08-06T16:17:36.192649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T16:17:35.450783Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.450783Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:59fff2cd2cd9bb7e3753cf5e14c2f31f1f40c312f60aad4ab4bd102825952c54","observation_id":"7786b8cc-d84f-4ec2-a684-b758ac9015f7","resolution":{"observed_at":"2026-08-06T16:17:35.450783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.182361Z","title":"Exploration by random network distillation,","venue":null,"work_id":"254f9999-cb8a-4bd2-9fc8-9b50b430421f","year":2018},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.511221Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:2cb080f30ad7b197524200d8a3bc8e247f60f1a0c20812fc75f97e6608a5dc88","observation_id":"7be9d931-503a-43e0-9f1a-065a9f2119ae","resolution":{"observed_at":"2026-08-06T16:17:36.184804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.584119Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.584119Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:e990d4383f571ae08da23afd9dc0802715c6afa955fd42631de0151b7a7d3fc3","observation_id":"88d8419b-af3a-4b5b-8697-f17d167b40be","resolution":{"observed_at":"2026-08-06T16:17:35.584119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.170219Z","title":"Reward learning from human preferences and demonstrations in atari,","venue":null,"work_id":"52af365e-0fbd-485e-91a2-b1ebcd3d1266","year":2018},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.668501Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:d2fff95affb0fc8f2fb2bd7794f2c31595bd7d01383a16b2f8a0881a7317f3dd","observation_id":"2af1f740-84f9-45f4-8b03-a71c0e055626","resolution":{"observed_at":"2026-08-06T16:17:36.173015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12130","last_updated":"2025-05-13T14:30:16Z","snapshot_observed_at":"2026-07-06T19:04:22.495890Z","submitted_at":"2024-08-22T04:54:25Z","title":"S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2408.12130","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.12130","snapshot_observed_at":"2026-08-06T16:17:35.964523Z","title":"S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning","venue":"cs.AI","work_id":"cc2fe6ba-1fea-46c1-bbe0-5c9e45abc4ce","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.749954Z"},"links":{"cited_paper":"/paper/2408.12130","citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:4704114ee4761ac63a38ecddb45892f6d059cc33731402cb3996362c79abd985","observation_id":"86d955f6-956d-453c-b71f-bf247c652a92","resolution":{"observed_at":"2026-08-06T16:17:35.967349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.161731Z","title":"Surf: Semi- supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning,","venue":null,"work_id":"15d1b4ba-a78a-49f1-b073-7f9acf35262d","year":2022},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.810695Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:4df46bc1b58b7585d578534e73233682c7b7677bdb92d4606272c67802a7c97a","observation_id":"8e1175aa-1ece-41da-a025-3a324564b00f","resolution":{"observed_at":"2026-08-06T16:17:36.165275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.154384Z","title":"Few-shot preference learning for human- in-the-loop rl,","venue":null,"work_id":"b87fdef6-bcb6-4bcf-9482-ac271fe145d8","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.840299Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:7005e6a90cb668d9d52ee7f6b56931bf286cd1722a95f2db4722ff51e0a03ae2","observation_id":"b70ba05f-268c-45fb-9cf8-5e797f7c0d36","resolution":{"observed_at":"2026-08-06T16:17:36.156940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.844045Z","title":"Learning to summarize with human feedback,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.844045Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:bfc42d4f55eaaddab46d6bfe87e20b7141280c0444665f4c1519d2348c7e4511","observation_id":"ad4b84f9-c650-4b4c-a6a4-c2e3eba99b98","resolution":{"observed_at":"2026-08-06T16:17:35.844045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.142697Z","title":"A toolkit for reliable benchmarking and research in multi-objective reinforcement learning,","venue":null,"work_id":"d1b6a6d8-28c3-43b8-a86a-d186128a311a","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.848219Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:37fb72cf3bbedaedbaf4a5990fda55226e8290304e328801b89e55109667de9c","observation_id":"468c6574-e772-4935-be5d-7550d1d20647","resolution":{"observed_at":"2026-08-06T16:17:36.145259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.135162Z","title":"A practical guide to multi-objective reinforcement learning and planning,","venue":null,"work_id":"f485495c-cd24-40d0-98eb-ead551d7796f","year":2022},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.851254Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:7a56978aa65c6b59d740b4684efe963129bb88e2958194c6770c95353fcc7c6c","observation_id":"112be415-f344-4a58-af0f-03915d8a1d6e","resolution":{"observed_at":"2026-08-06T16:17:36.137836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02160","last_updated":"2024-01-04T09:17:53Z","snapshot_observed_at":"2026-08-07T03:39:36.245437Z","submitted_at":"2024-01-04T09:17:53Z","title":"Human-in-the-Loop Policy Optimization for Preference-Based Multi-Objective Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2401.02160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02160","snapshot_observed_at":"2026-08-06T16:17:35.951074Z","title":"Human-in-the-Loop Policy Optimization for Preference-Based Multi-Objective Reinforcement Learning","venue":"cs.NE","work_id":"16c37952-162f-45bf-8d03-5d8a518cf7b4","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.855636Z"},"links":{"cited_paper":"/paper/2401.02160","citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:1894bef621df9f44423f4786dd2377b01a9edca1c7cdef9dc814c24bfb2c2dba","observation_id":"420d363e-a9f4-47b2-bd3e-6ef4f759e91c","resolution":{"observed_at":"2026-08-06T16:17:35.956243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.127715Z","title":"A generalized algorithm for multi-objective reinforcement learning and policy adaptation,","venue":null,"work_id":"59a53ec6-b263-420c-aa92-2b9b465c7c5c","year":2019},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.859598Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:78a309116fbf07cfda37a27910d3181e01c9c8b1d5ccbce050159b77a1368311","observation_id":"2712168f-f393-4094-ab35-cbfe5a78983a","resolution":{"observed_at":"2026-08-06T16:17:36.130297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.119581Z","title":"Multi-objective rein- forcement learning for the expected utility of the return,","venue":null,"work_id":"e40c5084-16ae-4901-9c7e-f4940470a945","year":2018},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.863547Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:4cb1f9b1607419d9457868ebd7d0e7c430459d79e07686c543ddbf50783f17ec","observation_id":"9eb1a771-cbb8-4150-a54b-76732f7c49cf","resolution":{"observed_at":"2026-08-06T16:17:36.122647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.865902Z","title":"Prediction- guided multi-objective reinforcement learning for continuous robot con- trol,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.865902Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:a47a82a385b3fdf595e0d2f84acebbef7989908cd88dcc8814c7c918a0a1ed6b","observation_id":"e893cdc1-7bfb-4641-8956-8dd0749bdc23","resolution":{"observed_at":"2026-08-06T16:17:35.865902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.106747Z","title":"Pareto conditioned net- works,","venue":null,"work_id":"6b343454-eaff-4e9e-bc3c-b8bad09ddb76","year":2022},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.869150Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:b4ff0470159fcd74280d553f7bf684a621f70d6d5c226cc7af1de5450e72ff64","observation_id":"a2dca11c-79cc-4b92-a95e-a824b1f95d7a","resolution":{"observed_at":"2026-08-06T16:17:36.109162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.098711Z","title":"Sample-efficient multi-objective learning via generalized pol- icy improvement prioritization,","venue":null,"work_id":"0a1f3188-6f1b-4c6b-941c-3baedba9ffa2","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.871852Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:714c0be360a39cbb065d02646ebd6204ddd9615ac26c65cd20458f0fa9e43655","observation_id":"1386df91-dd9e-4e2f-b578-ea283fac0c47","resolution":{"observed_at":"2026-08-06T16:17:36.101150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.874650Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.874650Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:f018710e9dc24f8cc7e63c8aa836b2c65a60da726d3ce7d12daaec49b47a7885","observation_id":"08479a28-5f7d-426b-b471-a1c561ec2fc0","resolution":{"observed_at":"2026-08-06T16:17:35.874650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.085945Z","title":null,"venue":null,"work_id":"d082f459-5fb2-4bc5-b4ab-7839e8b51a0d","year":1982},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.876997Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:8d20fbaf290b1340d944966bf685f344cdff2a112ce9bf53d0614622c089c225","observation_id":"8c28b02e-16f2-441c-8153-7ae6a43bdfd5","resolution":{"observed_at":"2026-08-06T16:17:36.089262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.879279Z","title":"Convergence of q-learning: A simple proof,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.879279Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:8000e18fc3e9262993889060fd0e7d5cc1bb1b64bda54283a1c85b885a951844","observation_id":"cdb7ec45-fc02-495e-9814-7e508caa2089","resolution":{"observed_at":"2026-08-06T16:17:35.879279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.073616Z","title":"Decentralized multi-agent reinforcement learning: An off-policy method,","venue":null,"work_id":"264388d9-2b48-498e-9327-fbdab89d3fa0","year":2021},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.881717Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:f64e349206bfaa3dd698dbb33181f5bf1558f6505883448fa0a5b7694c6f5c42","observation_id":"4dfa9a84-855f-4b7c-b202-e87470ba748c","resolution":{"observed_at":"2026-08-06T16:17:36.076420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.066275Z","title":"An ocba-based method for efficient sample collection in reinforcement learning,","venue":null,"work_id":"0a24dbe6-ba7d-4f10-925c-b067b9e586dc","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.884101Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:c6c79e991b70d159544c78c11fae4e248af0bce32ee18cfb927a3150cf041c11","observation_id":"7a7e2417-c332-43fb-bf14-0778f084600e","resolution":{"observed_at":"2026-08-06T16:17:36.068792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.886959Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.886959Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:cc56c3029b93202f1a1353d9709fdb8cdbdaae6adfbeacd38aab3f8fb2cd3ad7","observation_id":"3ddde7a4-ef4e-4b4b-beb2-67bb2f31f995","resolution":{"observed_at":"2026-08-06T16:17:35.886959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.054380Z","title":"Preference-based multi-objective reinforcement learning with explicit reward modeling,","venue":null,"work_id":"8e985898-9ad7-4125-91c8-b2cc369a679a","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.889314Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:e1a82ac4001115e06e14ac30ebb6506b3b8fe21dd1471f3b17ac3e222b7a6b6a","observation_id":"efa1052b-c7ae-4221-9dfe-a7afba883828","resolution":{"observed_at":"2026-08-06T16:17:36.057027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.045661Z","title":"Clarify: Contrastive preference reinforcement learning for untangling ambigu- ous queries,","venue":null,"work_id":"283a7380-2ce3-416c-8051-1fb411798d39","year":2025},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.891737Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:2b15d2278c47a196b83ff93ddb5f74c944f05d98b7bb655f5cc6993bca68cc72","observation_id":"fb1ad97a-90c7-48d6-a16e-e32ffce1f627","resolution":{"observed_at":"2026-08-06T16:17:36.048623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.037712Z","title":"Zitzler,Evolutionary algorithms for multiobjective optimization: Methods and applications","venue":null,"work_id":"40fb8ab2-96c1-47d1-a884-f4ab4123a67a","year":1999},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.894131Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:6a860d647baf5d9b74e804806fff5638bb94ba5d6fe4aa450f20250e8fa1add0","observation_id":"01e14327-69ca-4bd8-9cc6-d519c38dbc89","resolution":{"observed_at":"2026-08-06T16:17:36.040417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.030348Z","title":"Query-policy mis- alignment in preference-based reinforcement learning,","venue":null,"work_id":"dca26146-6e75-4744-adc5-c4a8a093d480","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.896952Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:3974e8075dbbad4acadf918dd7a931cafab2902ba948563996349b98d7625993","observation_id":"5470b709-8978-47df-bc91-e5981e8a03b3","resolution":{"observed_at":"2026-08-06T16:17:36.032810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.022375Z","title":"Empirical evaluation methods for multiobjective reinforcement learning algorithms,","venue":null,"work_id":"4f3e33c7-c115-4735-a124-4310b0a0c7d6","year":2011},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.899502Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:cdd6558f915fe2487d44c2750d1c79997ac77bebbd67819b3691d449fd99715f","observation_id":"04d09981-ffca-4a2a-bd60-afbd07ba336f","resolution":{"observed_at":"2026-08-06T16:17:36.024987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:36.014686Z","title":"Learning all optimal policies with multiple criteria,","venue":null,"work_id":"dfc15d2b-d6c7-4de7-b535-2889d8a36d6d","year":2008},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.902317Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:0b6437a8aa7dfc688dd2ef6d04d0d346ca851acf8881d83faddfa999c042959b","observation_id":"5c6d56b8-ce60-4bb6-bd21-65d694dd9faf","resolution":{"observed_at":"2026-08-06T16:17:36.017157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.905119Z","title":"An environment for autonomous driving decision-making,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.905119Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:a72c22039291e9671a4eaa025251f8f5d8b485761d32dd61170463b898b0afee","observation_id":"c6af2e34-a117-40a6-89e9-3164030e5849","resolution":{"observed_at":"2026-08-06T16:17:35.905119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.907272Z","title":"Congested traffic states in empirical observations and microscopic simulations,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.907272Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:91e4933b477ba75817b876e17b108e65bacf6cd116e765c73a4ed13e01e64496","observation_id":"99c5bb15-f318-4c62-bf1a-764392ecd9d8","resolution":{"observed_at":"2026-08-06T16:17:35.907272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.909933Z","title":"General lane-changing model mobil for car-following models,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.909933Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:cdf0be87e10f2ceb4ee3600d86f8ec1a2f89b5791cb412791dcd6975fac5d701","observation_id":"dc9de4e9-cb9f-4b63-b0de-a2ba264dd6e8","resolution":{"observed_at":"2026-08-06T16:17:35.909933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.993522Z","title":"Implementing deep reinforcement learning (drl)-based driving styles for non-player vehicles,","venue":null,"work_id":"61d78811-ab95-4e20-b607-5f38a120ec73","year":2023},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.912851Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:993cf3bf6d5137ddc50f450f7b820d0282f805f6a20fbc5f640920437a9bcef6","observation_id":"c6181032-1c83-4bd9-8cd5-c8e95428db13","resolution":{"observed_at":"2026-08-06T16:17:35.996133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08570","last_updated":"2024-04-12T16:13:10Z","snapshot_observed_at":"2026-08-04T08:10:31.496057Z","submitted_at":"2024-04-12T16:13:10Z","title":"Enhancing Autonomous Vehicle Training with Language Model Integration and Critical Scenario Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08570","snapshot_observed_at":"2026-08-06T16:17:35.915292Z","title":"Enhancing autonomous vehicle training with language model integra- tion and critical scenario generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.915292Z"},"links":{"cited_paper":"/paper/2404.08570","citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:b1f1e61d5b639eadf0d987fc2d7a93cce6097e3e5ea6af68798a4a81f16f92e3","observation_id":"c10ce3c5-a198-4c91-8f6b-450aeb1c1485","resolution":{"observed_at":"2026-08-06T16:17:35.915292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:17:35.986209Z","title":"Listwise reward estimation for offline preference-based reinforcement learning,","venue":null,"work_id":"e9e364b2-3491-43cd-a2a7-ad536600583a","year":2024},"citing_paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:35.918503Z"},"links":{"citing_paper":"/paper/2507.14066"},"observation_digest":"sha256:e4188b413ccc4bceaabb2bf9669f79d7c66f4d528888211a3b9dc85e30cf3236","observation_id":"2ab81b5d-f8d5-4169-aca5-ff1f79acf333","resolution":{"observed_at":"2026-08-06T16:17:35.988790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14066","last_updated":"2025-07-18T16:43:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T15:59:43.105055Z","submitted_at":"2025-07-18T16:43:04Z","title":"Preference-based Multi-Objective Reinforcement Learning"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2507.14066."}