{"as_of":"2026-08-15T15:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6717739ff821d572906d9a057be589833f93eefd8bbaef8f9bd5e56436d153fe","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:56:53.066373Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:02:40.822995Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":108,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-12T12:02:40.822995Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17585","last_updated":"2025-05-15T18:07:42Z","snapshot_observed_at":"2026-08-15T12:07:37.947052Z","submitted_at":"2024-11-26T16:51:52Z","title":"Multi-Objective Reinforcement Learning for Automated Resilient Cyber Defence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:02:40.822995Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2411.17585"},"observation_digest":"sha256:8a736954922a380570d298011a96e4b7b6f99b14c4a0d77e569b762ed4cbf3de","observation_id":"63bef60f-fe8e-48a0-a249-9dda6b632686","resolution":{"observed_at":"2026-08-12T12:02:40.822995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":"1908.08342","doi":"10.48550/arxiv.1908.08342","metadata_source":"pith","pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","venue":"cs.LG","work_id":"374b3960-7758-4f07-a8c5-f8bd484086a5","year":2019},"citing_paper":{"arxiv_id":"2507.19788","last_updated":"2025-07-26T04:30:11Z","snapshot_observed_at":"2026-08-15T12:07:36.903783Z","submitted_at":"2025-07-26T04:30:11Z","title":"Reinforcement Learning for Multi-Objective Multi-Echelon Supply Chain Optimisation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T14:07:57.803195Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2507.19788"},"observation_digest":"sha256:017f6d36cdda8ccafc7ead32adec19a7bd24349befaf76e9bd7f0af5e39d3aa8","observation_id":"1c03d6e4-220e-41eb-b9ad-f2e3900461cb","resolution":{"observed_at":"2026-08-06T14:07:57.858962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08342","snapshot_observed_at":"2026-08-03T03:33:04.179060Z","title":"org/CorpusId:271404860","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.07764","last_updated":"2026-07-10T14:03:51Z","snapshot_observed_at":"2026-08-15T12:07:39.942602Z","submitted_at":"2026-02-08T01:45:01Z","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:04.179060Z"},"links":{"cited_paper":"/paper/1908.08342","citing_paper":"/paper/2602.07764"},"observation_digest":"sha256:e7c8505053817e65c5fdb2bc54a3c8b1782b8c472e2453d9ab02d8ebff34b08d","observation_id":"77951548-8b8f-4916-baf2-c4370b614546","resolution":{"observed_at":"2026-08-03T03:33:04.179060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1908.08342/citation-record","integrity":"/paper/1908.08342/integrity","json":"/paper/1908.08342/citation-record.json","paper":"/paper/1908.08342"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-14T11:56:52.813828Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.813828Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:b4130253402f8338b9a6cb052ce6832edd8ef47621651a30a27567f2cc20049a","observation_id":"97ef9603-8df4-4bbc-801c-230e41a264fb","resolution":{"observed_at":"2026-08-14T11:56:52.813828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.936394Z","title":"Roijers, Peter Vamplew, Shimon Whiteson, and Richard Dazeley","venue":null,"work_id":"e13b4996-bc23-4978-a83e-8c8c6d831deb","year":2013},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.820258Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:133b15cea7a51a318d7676c4b8b1334bac266a388824abe87c68c636942429b7","observation_id":"fca53784-e075-4603-95eb-3bc58eb17670","resolution":{"observed_at":"2026-08-14T11:56:53.942019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.919161Z","title":"Adaptive weighted sum method for multiobjective optimization: a new method for pareto front generation","venue":null,"work_id":"f97615ec-03aa-4aca-94b6-23034c44a80f","year":2006},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.825573Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:785c0cf138386f38b2bdcd9213a0466a41295b9e71afde18561ab215404fcd36","observation_id":"e29e6484-9007-4478-9c02-51aee9c00e77","resolution":{"observed_at":"2026-08-14T11:56:53.924658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.901385Z","title":"Multi-objective optimization using genetic algorithms: A tutorial","venue":null,"work_id":"b9bec3bd-ca63-4124-bb47-bf382be04f21","year":2006},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.830839Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:8103529b015f148c03b58f91f0fbb0d7bd9c122f51d638881efc6c636c0cb67d","observation_id":"61f67dff-e0c2-4159-9024-e604e16842b8","resolution":{"observed_at":"2026-08-14T11:56:53.906878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.883336Z","title":"Sequential approximate multiobjective optimization using computational intelligence","venue":null,"work_id":"4e670ba9-acfb-40e7-abd6-78d7f6dc6495","year":2009},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.835921Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:6c9bca5dd8d2da24e2fde9d4f5f5dc9bacfefbdd0bf964dad1022bfbf1cf408b","observation_id":"43cac4b4-c847-47c1-b8d9-450d5a4d664a","resolution":{"observed_at":"2026-08-14T11:56:53.889514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.864949Z","title":"On min-norm and min-max methods of multi-objective optimization","venue":null,"work_id":"bd6a5e23-e3fa-4c8f-b00c-05fa033a60dd","year":2005},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.841004Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:89f1c25d3ea043cabfb6931eb9d821b8acaf1441fc289c5c753cad44982bf598","observation_id":"036cb003-056d-4a84-9cf8-0063c8caa124","resolution":{"observed_at":"2026-08-14T11:56:53.870039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.847450Z","title":"Dynamic preferences in multi-criteria reinforcement learning","venue":null,"work_id":"b55d75c9-1a8f-4dc6-9737-2e814fc327f5","year":2005},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.847083Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:e0f3ff1f808592ec77eabff9503467c32d6d6a2b134a361bab88b790b292750c","observation_id":"540d8384-3721-4d13-8ccd-3df0cc2c28e7","resolution":{"observed_at":"2026-08-14T11:56:53.853382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.828217Z","title":"Learning all optimal policies with multiple criteria","venue":null,"work_id":"c1343515-d1b0-4006-8383-61950c6091f9","year":2008},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.852167Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:424ce89d9c19006268ad217157936d5260b62b2b6e67942ef793a5080918bd57","observation_id":"4d5784b7-209b-4953-8a97-e3a9a4783d67","resolution":{"observed_at":"2026-08-14T11:56:53.834142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02707","last_updated":"2016-10-09T19:08:36Z","snapshot_observed_at":"2026-08-14T21:36:02.227068Z","submitted_at":"2016-10-09T19:08:36Z","title":"Multi-Objective Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02707","snapshot_observed_at":"2026-08-14T11:56:52.856988Z","title":"Assael, Diederik M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.856988Z"},"links":{"cited_paper":"/paper/1610.02707","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c0cd137c8d3e19eacc8ea760f5abed75d2e4cd55d418b9af04bd893369f8afc7","observation_id":"bb2a0f21-afc2-4288-92fb-e3ad7b0d4f41","resolution":{"observed_at":"2026-08-14T11:56:52.856988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.810877Z","title":"Dynamic Programming","venue":null,"work_id":"976d81e8-1330-45c2-9645-690b5eeaf875","year":1957},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.862064Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:03964006a01a352a72675575b30c9e30966a0dfc973f68648a87a55d7ed63894","observation_id":"9b589f4e-4b71-472d-b4bf-63a82c09bc04","resolution":{"observed_at":"2026-08-14T11:56:53.816157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.795911Z","title":"Hindsight experience replay","venue":null,"work_id":"999765e3-6e02-48f2-9826-892f4a396b4c","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.866600Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:0e28187ea1a781bd92165adea1cb8f3b35084e0c9eaf03bd4274d244a6880937","observation_id":"ec5d1b04-e29e-4e39-88d0-08d17b04ba24","resolution":{"observed_at":"2026-08-14T11:56:53.800632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:52.871512Z","title":"Modern homotopy methods in optimization","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.871512Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:1492828dc4067274e2eb47a3740804661715bcc7106dcb0ee5c46352f9ae8eeb","observation_id":"4febe6f2-c1bf-47a5-81a8-5aa9ba6c6ee9","resolution":{"observed_at":"2026-08-14T11:56:52.871512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.770381Z","title":"Roijers, Tom Lenaerts, Ann Nowé, and Denis Steckelmacher","venue":null,"work_id":"c0b0bcb3-aced-477c-834a-08e47b15fa41","year":2019},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.876371Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:8d8aebb07534fccb477636904cd46360f0d528f070bb2cc0c44717c663a65de3","observation_id":"b14b194a-4c3d-4535-81df-66472e260cfa","resolution":{"observed_at":"2026-08-14T11:56:53.775229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.752958Z","title":"Empirical evaluation methods for multiobjective reinforcement learning algorithms","venue":null,"work_id":"3763f597-857e-4795-b686-4900492ead80","year":2011},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.881183Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4bbb293796cacdb198d98e708f2a360ff7f7d7c904c449c3eddd40f1d7543718","observation_id":"04e44619-49c7-43d2-8ed4-6274fe94e091","resolution":{"observed_at":"2026-08-14T11:56:53.758719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.736861Z","title":"Multiobjective reinforcement learning: A comprehensive overview","venue":null,"work_id":"a4a6b55c-1e02-4a19-833d-66d6668f872b","year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.886387Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:271db8bc379589cd70b837009595f561e5e3f5f07dd6d1090f22ff64397efcd0","observation_id":"13798454-20f3-40d4-a6e7-214c9c52134c","resolution":{"observed_at":"2026-08-14T11:56:53.741889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.720823Z","title":"The steering approach for multi-criteria reinforcement learning","venue":null,"work_id":"5d2f3c30-307a-4348-8079-6c331a70c546","year":2001},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.891159Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4f3b34c8160142f57b40b80271f2604259c6989ab8faf7c161ceeba7ad0ca727","observation_id":"44155fb4-dc3c-4237-aa59-60f21f1f21c3","resolution":{"observed_at":"2026-08-14T11:56:53.725928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.706140Z","title":"Kephart, David Levine, Freeman L","venue":null,"work_id":"0280255e-5aa6-4e29-b2e5-69c351681e65","year":2007},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.896019Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:edeb079127b5955da7a790ed6afcf8d9c34c35c7c7f675b0257a6e1aa7b33e66","observation_id":"f96fc766-e30b-4f3b-9b1e-fda761680b35","resolution":{"observed_at":"2026-08-14T11:56:53.710904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.690783Z","title":"Drugan, and Ann Nowé","venue":null,"work_id":"a543ad86-ce82-4800-b739-e693dea60e35","year":2013},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.900892Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:9d0cb9dbfc1581584c4fbfefda99cfd5b98db0a2115309b75c3956b6e8216b09","observation_id":"08a171c2-236f-4eef-8574-cf608612f3e9","resolution":{"observed_at":"2026-08-14T11:56:53.695493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.676221Z","title":"Multi-objective reinforcement learning with continu- ous pareto frontier approximation","venue":null,"work_id":"36dc7d60-ac0b-450b-8166-89bfd6c816c6","year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.905378Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:d7ba266cedac37fb1b8e8a36dd54efe8ebdc59b9a2aad918438be7329ec88b39","observation_id":"b9a95802-83bd-4d67-9ccb-5e896214377f","resolution":{"observed_at":"2026-08-14T11:56:53.681144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.661733Z","title":"Manifold-based multi-objective policy search with sample reuse","venue":null,"work_id":"29a02ca6-2ff8-4aba-aed3-81ba4e5e92ef","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.910004Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4813602763030dcc2e4e72a8794050e3552d8d61e2fe268c3bfee667d1c19a6b","observation_id":"6eb876e7-22a6-4ea5-83b9-aa6182406405","resolution":{"observed_at":"2026-08-14T11:56:53.666604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.647078Z","title":"Parallel reinforcement learning for weighted multi-criteria model with adaptive margin","venue":null,"work_id":"def70805-f461-4722-9bcf-b58e445f1e47","year":2007},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.914976Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:22b3e9b4503a6711bdf543f906b086fa9057c45835dbe39d1293e919959760b4","observation_id":"0fb281ef-9971-4042-8fd3-494e061c276f","resolution":{"observed_at":"2026-08-14T11:56:53.651871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.630944Z","title":"Multi-objective reinforcement learning for acquiring all pareto optimal policies simultaneously - method of determining scalarization weights","venue":null,"work_id":"642e4919-998b-48f4-8b3d-e4e9cd42b2a4","year":2014},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.919854Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:311d3fea37001ea4573215e0bbc4fe1b653e7367bbdd0355875af91216e040b4","observation_id":"b8e525ba-1402-4a51-ad84-3124b557be9c","resolution":{"observed_at":"2026-08-14T11:56:53.636295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.614386Z","title":"Multi-objective ﬁtted q-iteration: Pareto frontier approximation in one single run","venue":null,"work_id":"37a7a530-e375-46c5-93d4-936873c648c6","year":2011},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.924752Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:10bd13d23a9fad3f624bfcc9e6aab6c26d5b969f58472710586dbf1e3e919b4d","observation_id":"2cc3fb91-b85c-4cf9-aa8e-8b917cc3bdc9","resolution":{"observed_at":"2026-08-14T11:56:53.619958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.596079Z","title":"Tree-based ﬁtted q-iteration for multi- objective markov decision problems","venue":null,"work_id":"a1ba4ef4-01cc-44e8-b511-2228d92f8047","year":2012},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.929409Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:340ea47013a24d143100524e386b143ca96898363ef9d4e29b9f526c6cb92f10","observation_id":"864a7839-e25b-455c-9153-e016bf5a9993","resolution":{"observed_at":"2026-08-14T11:56:53.601821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.578345Z","title":"Preference elicitation in combinatorial auctions","venue":null,"work_id":"199f839b-5af3-4b2b-a0a5-3e51ac00a620","year":2001},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.934071Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:f47bb68b532f75e3ef9c0540e82cce07b0c67d6122afd5fe8456868d6fee6e41","observation_id":"771284cd-6819-4f77-917d-1e48b20d2779","resolution":{"observed_at":"2026-08-14T11:56:53.583464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.562148Z","title":"A POMDP formulation of preference elicitation problems","venue":null,"work_id":"23fb6467-abc0-4b49-bd7d-eb61aed3e41b","year":2002},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.938393Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:5abc96ac518bf02874fd6f1206f275e8fbb322b7c3b57c49c80d2eb23abbd84b","observation_id":"2cbcf60e-c1ad-434b-959c-abd0c90cb950","resolution":{"observed_at":"2026-08-14T11:56:53.567318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.540776Z","title":"Survey of preference elicitation methods","venue":null,"work_id":"a9291512-aa5d-4da1-8420-9e46fcc2644e","year":2004},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.943072Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:8eaa30a74725ba23c5733c906e9a05e20310dfc45d75d8cf665ba8ecc6e916fc","observation_id":"c9b3baff-61b3-46b7-a1b5-a7fdb790f07d","resolution":{"observed_at":"2026-08-14T11:56:53.550755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.523609Z","title":"Ng and Stuart J","venue":null,"work_id":"b5fbc9c1-923f-477b-9d60-a3ef4fc1ee7d","year":2000},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.947895Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:9f90beb85343195c1b6e2b07f6365e94ce44fc79044afe169cc49fcef8ace0e0","observation_id":"6fede5a3-f0ff-45cb-978c-c6e5ddde259c","resolution":{"observed_at":"2026-08-14T11:56:53.529736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.506773Z","title":null,"venue":null,"work_id":"2af5926e-11f6-4c30-826d-a4c20cea004a","year":2004},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.952544Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:74df500df7f8d50602c6c09e138859ce5f8d7c066e04da6bbd9e27025241a56b","observation_id":"21513b33-8442-4274-b6a9-613df94bfd04","resolution":{"observed_at":"2026-08-14T11:56:53.512350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:52.957457Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.957457Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4d3d0c5f06e34b4a95ed45a4debae714089af43271a15059519db8e0e701cd14","observation_id":"57e6c74e-639e-403b-8c52-d96f417ff1e0","resolution":{"observed_at":"2026-08-14T11:56:52.957457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.481231Z","title":"Learning an agent’s utility function by observing behavior","venue":null,"work_id":"f99f98ee-2503-4acc-b0d0-37b07b6b6642","year":2001},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.962385Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:970685d7ea458b355c14dc5cdca7440af2e67f40afcd02d89fd174c1e19e470f","observation_id":"ece7dc7d-7b41-45dc-8893-9e7480650ac0","resolution":{"observed_at":"2026-08-14T11:56:53.486060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.466133Z","title":null,"venue":null,"work_id":"3a20ccaa-44be-4d46-a02c-9e27e16b79fb","year":1992},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.967348Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:a5e659ee3cd8ee628720cde929edc1dfdb4ebdba2e6a0f7d3976e11fdf98ffe2","observation_id":"da78da7b-030d-47d3-ad0e-9ad67d475697","resolution":{"observed_at":"2026-08-14T11:56:53.470860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.451254Z","title":"Linear operator theory in engineering and science","venue":null,"work_id":"2305cdf3-f271-446c-8e70-2c6d310dd989","year":2000},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.972335Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:9b714c92e1629afff9a9032b1b777f60d1bcc83a21da1bb193053145da43a3ed","observation_id":"2300fa20-8c1d-4fcc-99ee-2f20caac3983","resolution":{"observed_at":"2026-08-14T11:56:53.456526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.435860Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"91e96cb8-5e1a-41c1-a6ff-57e875ca243e","year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.977191Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:b83091d1e003c357b2a2ebc640dd5f06f1d3e025b1b110913c6c9878298efa72","observation_id":"44e7c2b4-06b6-49e6-bbc4-2401d8240d7b","resolution":{"observed_at":"2026-08-14T11:56:53.440711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.420753Z","title":"Williams","venue":null,"work_id":"be1c7282-7861-4c4e-9ed4-ee9534f423f8","year":1992},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.982168Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:fb94f7491e7334b18ddfe3e040d99eb1ec10283957bf4047745dddede09d2dff","observation_id":"b4642eb0-effd-478e-a960-f3d7e38de072","resolution":{"observed_at":"2026-08-14T11:56:53.425579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.405764Z","title":null,"venue":null,"work_id":"f4329997-1d08-44ce-9e75-4420aa8e4fdb","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.987432Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:3672a09d007d39763a230350326316517d53a705bdb99dba9725194a98e960bd","observation_id":"fcd0fe89-6a1e-40f7-89bc-39484dbb44e5","resolution":{"observed_at":"2026-08-14T11:56:53.410789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.390758Z","title":"Super Mario Bros for OpenAI Gym","venue":null,"work_id":"80efcc44-774d-430c-8c96-3d6239c2f47a","year":2018},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.992400Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:da8f47f7f41cc40f12f59b23a57fd43a5c6d9934537045c824f32d77cdc406b1","observation_id":"d90ebf58-5692-4913-a2fb-54b6e1e2fb07","resolution":{"observed_at":"2026-08-14T11:56:53.395851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.375773Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":"d270afc3-f633-4190-bdc0-d2d92392fada","year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:52.997070Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:62854d3f4608a10e884cf0194bc91b8febfb69046b12c80d2b6b9f45cb346075","observation_id":"6c051386-6c0e-423d-8262-32f29e3ab58a","resolution":{"observed_at":"2026-08-14T11:56:53.380875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.360850Z","title":"An introduction to metric spaces and ﬁxed point theory , volume 53","venue":null,"work_id":"c4b61fac-57fc-4202-8f5e-9b318bf48354","year":2011},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.001549Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:1612b3db3a6cab6b66f5bebc78a19cb004391bcdcde0c8efbbcd0971affefb91","observation_id":"55ec15d9-1de6-4ba3-824d-74e674ebeb64","resolution":{"observed_at":"2026-08-14T11:56:53.365683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.345739Z","title":"Bertsekas","venue":null,"work_id":"df72386a-1c58-4353-9576-4bac40b78262","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.006206Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c6ac91e9d98df667794a58b935d24d056bd39138425036a8dd2a057cb7092fa9","observation_id":"8b692673-271d-4975-b4ca-314fe904f370","resolution":{"observed_at":"2026-08-14T11:56:53.350469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.330459Z","title":"Abstract dynamic programming","venue":null,"work_id":"87775480-02a7-4112-b428-5173e177bea4","year":2018},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.011645Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:c4fa76335722ab0a1292e88c79e14b1cce983dd4f84278484008f90e6b6d36e7","observation_id":"09e96095-5683-4f31-869a-6b6fd7bfc207","resolution":{"observed_at":"2026-08-14T11:56:53.335525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.312971Z","title":"Bellemare, Will Dabney, and Rémi Munos","venue":null,"work_id":"df4c70dd-a941-4990-8375-42bfccbec1a5","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.016268Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:6500dff4e0b53dd636f5cb2536cdc765f6ee45e9473f49aff83cd94ae5f672e0","observation_id":"ae4ed655-411f-4a5f-b5a4-2ddab26ad216","resolution":{"observed_at":"2026-08-14T11:56:53.318359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.296613Z","title":null,"venue":null,"work_id":"1ff1fc3a-0da2-4216-a714-9d33d4633cc5","year":2009},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.020970Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:d2f5b57db636f98184dd8e098980dc2fd7ea88febe5639650e4f9287ab35f109","observation_id":"53faeaeb-8ad9-41f2-9e1a-5c9ffb3c2dbd","resolution":{"observed_at":"2026-08-14T11:56:53.301369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.280185Z","title":null,"venue":null,"work_id":"2a2f6deb-b96d-4053-879e-06552f6b50a2","year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.025666Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:d062c864ab65852d49812a7f4d5a057fb686ca686fae2a89b405429ab4fd281a","observation_id":"abc54813-b7b9-4f31-a20c-61254d0d0439","resolution":{"observed_at":"2026-08-14T11:56:53.285223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-15T12:04:28.662048Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-14T11:56:53.030338Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.030338Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:4891325d8d97e782aa6f07c93e6f3064bc8e87c6ba6e4e6a3b7b5129e3dfbe47","observation_id":"9685e182-42af-4feb-aadb-17ca3c16f4de","resolution":{"observed_at":"2026-08-14T11:56:53.030338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.263158Z","title":"Lillicrap, Ilya Sutskever, and Sergey Levine","venue":null,"work_id":"050f5569-4966-42de-8714-df5ffe81fc28","year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.035324Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:e3edd1b389838ee1ada801d867c78042bf0370b1df2d12b7b53ca74e5cf1c146","observation_id":"44b7b07d-b4bb-44df-a302-5c30148d8cb7","resolution":{"observed_at":"2026-08-14T11:56:53.268052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05035","last_updated":"2019-06-08T00:56:16Z","snapshot_observed_at":"2026-08-14T21:00:48.813378Z","submitted_at":"2017-05-14T22:53:13Z","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05035","snapshot_observed_at":"2026-08-14T11:56:53.040237Z","title":"Discrete sequential prediction of continuous actions for deep RL","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.040237Z"},"links":{"cited_paper":"/paper/1705.05035","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:e42c385f05951ab74c94ebe34fe896dd8ae075ba3336fbd40ecd1e529f4a2867","observation_id":"96f47eb8-f3d4-48f7-9303-ceffb0850709","resolution":{"observed_at":"2026-08-14T11:56:53.040237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.246549Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"aeb11300-b395-44d7-913e-50d051571d88","year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.046149Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:677660d73502f246da437cd777a2eca0c8ffbad80a68be8a7ad291bddf4df19d","observation_id":"2fb1e13f-327b-4261-be39-20ab4bf3c5d1","resolution":{"observed_at":"2026-08-14T11:56:53.252418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-14T22:22:20.346852Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-14T11:56:53.050880Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.050880Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:313ad664bd54cf31e80399617b811426b7c9e6f623467f0e49b1ab9047a02f67","observation_id":"6af8a5c1-7d74-4831-bcee-da4373d59237","resolution":{"observed_at":"2026-08-14T11:56:53.050880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.230230Z","title":null,"venue":null,"work_id":"4651385b-9f79-44d0-8f49-a1935a5e2312","year":2008},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.055989Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:8f2b59316ff9d337b1d5835c5c52276ce3e4aceba79bf56d51b71635f47fedf2","observation_id":"09fe7a03-3e45-4254-98c2-4a39f857887c","resolution":{"observed_at":"2026-08-14T11:56:53.235078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.214585Z","title":null,"venue":null,"work_id":"23edf2de-43f7-4c87-b79b-b01638359602","year":null},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.061320Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:e104fb76e30583fc2e952f08fcb077b41331b59e38329ed64d026eef1fde0296","observation_id":"2472494a-0850-477a-9351-a95d7de76bca","resolution":{"observed_at":"2026-08-14T11:56:53.219524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:56:53.197556Z","title":"distance","venue":null,"work_id":"5f338cec-6552-4f64-b42c-d674f431e6b5","year":null},"citing_paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T11:56:53.066373Z"},"links":{"citing_paper":"/paper/1908.08342"},"observation_digest":"sha256:59dae89088076535660c5e5fd26ea68f28a2bd6f0b321c978f6e277970c15bed","observation_id":"b9507c95-d276-4b46-82c7-954cd185ffc5","resolution":{"observed_at":"2026-08-14T11:56:53.203911Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08342","last_updated":"2019-11-06T06:36:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T12:41:44.838978Z","submitted_at":"2019-08-21T17:54:14Z","title":"A Generalized Algorithm for Multi-Objective Reinforcement Learning and Policy Adaptation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 3 inbound Pith citation observations for arXiv:1908.08342."}