{"as_of":"2026-08-21T10:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9a2fcc239890f314ca66dbf730591796e88e61d43ed4a6feae20e58cc3d1fc4","coverage":[{"denominator":297,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:39:31.713492Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29559/citation-record","integrity":"/paper/2607.29559/integrity","json":"/paper/2607.29559/citation-record.json","paper":"/paper/2607.29559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.589269Z","title":"Structure and Interpretation of Computer Programs","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.589269Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2cb07d2a1881a850f77755e10c980deb1d07fa92515247f03021aaeac364ce83","observation_id":"5bee8ff9-5c58-4934-b338-19479b3eb5f2","resolution":{"observed_at":"2026-08-03T04:39:30.589269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.593231Z","title":"Visual Information Extraction with Lixto","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.593231Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:617aa59706e107de62d8c591a422b83fedcaa4e0633a6b1060b10fa3f5a72065","observation_id":"9b30f37c-da2c-481c-bfa0-4e9f6ecc15f4","resolution":{"observed_at":"2026-08-03T04:39:30.593231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.597128Z","title":"Brachman and James G","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.597128Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:17b0900d7cf2f3a0e82d64e90a63856ac6d088f8d9b56897d16e317f9e504282","observation_id":"f188bd46-0683-490f-8df6-c71ba6d0e7b3","resolution":{"observed_at":"2026-08-03T04:39:30.597128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.601312Z","title":"Complexity results for nonmonotonic logics","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.601312Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:d8fe52f86eb2fa5bc2d3f91b2530f0ae81e9ba71204d8aafd7610cd75f5d892b","observation_id":"a4b422d4-937d-47da-9294-400f8b6dd384","resolution":{"observed_at":"2026-08-03T04:39:30.601312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.604828Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.604828Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:6f0c8b763755c1a66bb6c811dc6c153c86bd9a493bca0355a1331e3888e7f5af","observation_id":"1791ea39-2bd3-4a9a-845a-4e9d3e1396b7","resolution":{"observed_at":"2026-08-03T04:39:30.604828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.608263Z","title":"Hypertree Decompositions and Tractable Queries","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.608263Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:21b65bfdc5a5cbb60b2a436e5882169665aa2f70d9f268db1b74040ed8b4a71f","observation_id":"a2b936d4-1aac-468b-ad57-d588e4de3995","resolution":{"observed_at":"2026-08-03T04:39:30.608263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.611943Z","title":"Levesque","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.611943Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:bd7a49c059660932f53b7fa84e2311bf2845ce296f47f195a6554b1f42979a85","observation_id":"874628da-b357-4d2b-b021-20f4df54aff4","resolution":{"observed_at":"2026-08-03T04:39:30.611943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.615468Z","title":"Levesque","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.615468Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:a0852944ce1071f71ed5cb93ad3eb97538af6746d075ae4c63ddad1573982b74","observation_id":"718dda53-a904-439c-8cec-b0e522001c5b","resolution":{"observed_at":"2026-08-03T04:39:30.615468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.619045Z","title":"On the compilability and expressive power of propositional planning formalisms","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.619045Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:f4c794c74e7d6d50cc8429c91c6a7781f8dce0cc1ff8e24f1eadd1c47b6b74fc","observation_id":"3f5d6fc0-6329-4d30-ac5b-612dbc22a701","resolution":{"observed_at":"2026-08-03T04:39:30.619045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.622204Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.622204Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:afae4f66462356713115f360ee6fe77d662e162077ea0101b62fa837dd989b3d","observation_id":"5c012139-7e05-4380-8366-8b1ecf6f9a68","resolution":{"observed_at":"2026-08-03T04:39:30.622204Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.625671Z","title":"The Knowledge Engineering Review , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.625671Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:c58f2508749d88f53fbf23f4cf345b8d993667ce23b375a2f02ec1852ef7c503","observation_id":"6857fca7-2dc5-41bd-ac20-fec6fefca1b9","resolution":{"observed_at":"2026-08-03T04:39:30.625671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.629782Z","title":"Artificial Intelligence , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.629782Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:bf0c3b020e02043ccd877496b0bbad00eed2a6a7fe66b901c04c229cdbb0e192","observation_id":"5145e282-dee6-4f7a-aaf6-794fbe7f9b2d","resolution":{"observed_at":"2026-08-03T04:39:30.629782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.633251Z","title":"Logics of programs: axiomatics and descriptive power","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.633251Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:97b34eaf5182c1a5fab2e54505b0932249ada8f452cc9e5cef5d2fc17e36f793","observation_id":"28349626-1ec0-4800-bc66-552eef11895c","resolution":{"observed_at":"2026-08-03T04:39:30.633251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.637314Z","title":"Clarkson","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.637314Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:7da0d3e37aa1e4062e38a964e13ce91b814241d8517bfc2701acec8f15f340e0","observation_id":"00802faa-6e1c-4d96-ab0b-ac437ee5a7a2","resolution":{"observed_at":"2026-08-03T04:39:30.637314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.640616Z","title":"A More Perfect Union","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.640616Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:c97c84a875a9ff28dbe90ab6fcf5662ccff1e25ddcacfa86eaa876977d4d9a68","observation_id":"9a2c6029-d150-4ed9-b5f9-13ef503b7f71","resolution":{"observed_at":"2026-08-03T04:39:30.640616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.644592Z","title":"The fountain of youth","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.644592Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:3a75959f6bb64612b3acbd4a7d81f40f6888c9ffa1cdbbe5754e844e567d6d00","observation_id":"fa38e6a1-b867-410e-96e5-aaf08eedfcb9","resolution":{"observed_at":"2026-08-03T04:39:30.644592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.648325Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.648325Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:c5807115ca2e7f4d4da62fbf7dd4f0a9e744e14f75e71b9a324704bab9adcc25","observation_id":"94a46ff4-018c-4ca9-8cfc-eb50925f6c5c","resolution":{"observed_at":"2026-08-03T04:39:30.648325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.651978Z","title":"Proceedings of the 20th International Colloquium on Automata, Languages and Programming , series =","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.651978Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:5af7d74f81c5bc0f37b1a22d99e55c7872657e2d39353790d7f5ba5a2c663fb7","observation_id":"7b35fef3-5325-4b20-855b-3503a655c8b2","resolution":{"observed_at":"2026-08-03T04:39:30.651978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.655272Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.655272Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:25f3d6cbd836fa07cb5c50d242f4df84cc6ab7e4ba7a50ee3da782ad55bac028","observation_id":"e0696e14-2f17-45cd-9113-515c1ccab64e","resolution":{"observed_at":"2026-08-03T04:39:30.655272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.658830Z","title":"Anisi , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.658830Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:a574fc997d9a719ed584ffb174290b23f6d5826e64deb9f1524b7528fbcb3ea5","observation_id":"b0ca4f76-3181-44dc-9806-784ed28f8ec7","resolution":{"observed_at":"2026-08-03T04:39:30.658830Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.15702","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Journal of Artificial Intelligence Research , author =","venue":"Journal of Artificial Intelligence Research","work_id":"aeca30e2-343b-48c6-893d-40e0cdcee2ec","year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.663083Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:92bdb82382550b47a6d35ee08e8edd3b018797642af52cea65227371952b8495","observation_id":"e8027626-9377-4990-a60d-30ef340c0f38","resolution":{"observed_at":"2026-08-03T04:44:22.845500Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:13.523586+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:13.523586+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.667119Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.667119Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:27eaa2c4c1dbfccc34e68b940cda128e1034576403ecc2e122a2b3c5ada0e03d","observation_id":"6cf07bab-36b6-42d1-aaa7-7cf783553107","resolution":{"observed_at":"2026-08-03T04:39:30.667119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.671077Z","title":"Reinforcement Learning , author =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.671077Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:eacdb0cca65d28f9473f455b42a6e07ad08c8c747066cef617b69d7ba78156d8","observation_id":"8f9dd01d-2f57-4723-82e6-86a18ceda1b4","resolution":{"observed_at":"2026-08-03T04:39:30.671077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.674550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.674550Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:17de4712b0168bdea940bbe0f40df653955bd04abf9e09cd63a6c0b34836b23e","observation_id":"5295577c-5a5c-4fd0-a3fd-26657c5e5361","resolution":{"observed_at":"2026-08-03T04:39:30.674550Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17431","last_updated":"2025-01-29T06:14:27Z","snapshot_observed_at":"2026-08-16T12:58:27.379300Z","submitted_at":"2025-01-29T06:14:27Z","title":"Human-Aligned Skill Discovery: Balancing Behaviour Exploration and Alignment","version":1},"cited_work":{"arxiv_id":"2501.17431","doi":"10.48550/arxiv.2501.17431","metadata_source":"pith","pith_arxiv_id":"2501.17431","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Human-Aligned Skill Discovery: Balancing Behaviour Exploration and Alignment","venue":"cs.LG","work_id":"b751c216-3d51-4fc9-9920-d0ee8d3230ec","year":2025},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.677776Z"},"links":{"cited_paper":"/paper/2501.17431","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:9c1bfdbb7758ef9d37deab21974d8d1fb8042d2f486edfedf666b3e534e4c95b","observation_id":"98c2686b-c84a-4893-9817-5c9a2595a88e","resolution":{"observed_at":"2026-08-03T04:44:22.697127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:13.571343+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:13.571343+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07182","last_updated":"2025-02-06T07:55:20Z","snapshot_observed_at":"2026-08-16T14:19:33.996952Z","submitted_at":"2024-02-11T12:35:13Z","title":"Divide and Conquer: Provably Unveiling the Pareto Front with Multi-Objective Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2402.07182","doi":"10.48550/arxiv.2402.07182","metadata_source":"pith","pith_arxiv_id":"2402.07182","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Divide and Conquer: Provably Unveiling the Pareto Front with Multi-Objective Reinforcement Learning","venue":"cs.LG","work_id":"70eabfac-2585-4e94-a6f8-c0e8b3e386d6","year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.681667Z"},"links":{"cited_paper":"/paper/2402.07182","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:8da526166aaf83087a63a6816d58d0f172b67df7d853ae1dc3ba95d356597bad","observation_id":"6b68dfec-b62d-4cd2-a103-c5f50a2c0958","resolution":{"observed_at":"2026-08-03T04:44:22.607261Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:13.645157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:13.645157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09995","last_updated":"2023-09-01T05:04:28Z","snapshot_observed_at":"2026-08-16T15:23:15.935400Z","submitted_at":"2023-06-16T17:47:36Z","title":"Fairness in Preference-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09995","snapshot_observed_at":"2026-08-03T04:39:30.685468Z","title":"Fairness in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.685468Z"},"links":{"cited_paper":"/paper/2306.09995","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2820ab0dfadeffa9283744be2c336706a478432cf95e2c9fd1785c5b9c803b1f","observation_id":"bbc5ba6b-ab98-4543-aa82-cbf85e72c605","resolution":{"observed_at":"2026-08-03T04:39:30.685468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11564","last_updated":"2023-10-17T20:22:13Z","snapshot_observed_at":"2026-08-19T17:50:35.007786Z","submitted_at":"2023-10-17T20:22:13Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11564","snapshot_observed_at":"2026-08-03T04:39:30.689529Z","title":"Personalized","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.689529Z"},"links":{"cited_paper":"/paper/2310.11564","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:8b6b5d7205a39789c15c120eb04401405bd30820a7eba7a10966adbc98a2b1ea","observation_id":"7311e445-1e27-4c5f-ba38-dddb4f2487ce","resolution":{"observed_at":"2026-08-03T04:39:30.689529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.693991Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.693991Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:e17007953eb477bbae81ac3e3f5d6113b2f21cd7e301e3d79505771baea302d3","observation_id":"e4467589-f136-4aa9-88bd-8a31f7fa049c","resolution":{"observed_at":"2026-08-03T04:39:30.693991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09337","last_updated":"2023-12-14T21:00:56Z","snapshot_observed_at":"2026-08-16T14:34:36.509422Z","submitted_at":"2023-12-14T21:00:56Z","title":"Promptable Behaviors: Personalizing Multi-Objective Rewards from Human Preferences","version":1},"cited_work":{"arxiv_id":"2312.09337","doi":"10.48550/arxiv.2312.09337","metadata_source":"pith","pith_arxiv_id":"2312.09337","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Promptable Behaviors: Personalizing Multi-Objective Rewards from Human Preferences","venue":"cs.CV","work_id":"b0cf0046-55a9-4d30-a4f5-bb2637d6d313","year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.697817Z"},"links":{"cited_paper":"/paper/2312.09337","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:f4088f1f99ac02fcbadfd0411454cc5257f745130af093a65128e0dd81559754","observation_id":"9295a79a-5eeb-4002-8212-51dcb5f837c8","resolution":{"observed_at":"2026-08-03T04:44:22.467309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:13.768934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:13.768934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.702262Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.702262Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:9c3499a313fe9f5f30b23b727261cc0f849bdf06894d38635a0ae3ebcea2faa5","observation_id":"14452a8c-e7fb-4342-8515-23dc6816b271","resolution":{"observed_at":"2026-08-03T04:39:30.702262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15006","last_updated":"2022-11-28T02:24:14Z","snapshot_observed_at":"2026-08-19T18:02:02.753747Z","submitted_at":"2022-11-28T02:24:14Z","title":"Fine-tuning language models to find agreement among humans with diverse preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15006","snapshot_observed_at":"2026-08-03T04:39:30.705616Z","title":"and Chadwick, Martin J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.705616Z"},"links":{"cited_paper":"/paper/2211.15006","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:5a901647d3340e6e8be3e1556479d259a4596c25bcf9f2cf7c5da6046e0f07e3","observation_id":"996524c1-8261-4f57-9c33-36780dec384a","resolution":{"observed_at":"2026-08-03T04:39:30.705616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23630","last_updated":"2024-10-31T04:46:52Z","snapshot_observed_at":"2026-08-20T02:12:16.017515Z","submitted_at":"2024-10-31T04:46:52Z","title":"Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23630","snapshot_observed_at":"2026-08-03T04:39:30.709335Z","title":"Adaptive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.709335Z"},"links":{"cited_paper":"/paper/2410.23630","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:606bd474f8159e82be70cbb002318dc8e96208642fc4232769d1ecfa79a353ed","observation_id":"3bd86fb5-4b35-472d-a65a-1b88e422cdaa","resolution":{"observed_at":"2026-08-03T04:39:30.709335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.713064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.713064Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:6d0a5187f3b87cd9bfbda88755c9959579a6c2be1e18c953db0a8b6dcff92edb","observation_id":"b756a39e-1aa6-4116-b690-3c3671133fb9","resolution":{"observed_at":"2026-08-03T04:39:30.713064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.716496Z","title":"2024 , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.716496Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:a1a273d1a1c7ac9adcc0b4882553fc7b0c16bfbaed7eb4c763730677373f7d50","observation_id":"9a6c6a0f-78f6-4c38-84fa-8fdfeed44829","resolution":{"observed_at":"2026-08-03T04:39:30.716496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.719807Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.719807Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:ff72ad1ebe450e4c1b5e32026ea6bedb195d0770ff10a5f588e112c0893edec7","observation_id":"3e0eed1b-71b7-41d5-b112-ebdecbe953e8","resolution":{"observed_at":"2026-08-03T04:39:30.719807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.723081Z","title":"and Yang, Diyi and Vosoughi, Soroush , month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.723081Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:ce9e3942c08b138528094c663d7d40071a4d757b69b5835572513662e700c051","observation_id":"8994e582-dfc2-45a5-bb47-dd15029abe7b","resolution":{"observed_at":"2026-08-03T04:39:30.723081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.727111Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.727111Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:374505460e3cc2f39eefea171a6744aaba1e23581a2cd748502af3b4adc50008","observation_id":"0dc6aa27-f5cb-4155-ad93-1d27d700f73e","resolution":{"observed_at":"2026-08-03T04:39:30.727111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.730473Z","title":"and Hassenzahl, Marc , month = jul, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.730473Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:fae5e1f02fb28ec6dd148cb80b902cb5b82eae20f87cff6582d97b8b10d9b2c9","observation_id":"9f051224-659f-489d-b2b7-27447a6814e0","resolution":{"observed_at":"2026-08-03T04:39:30.730473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.733862Z","title":"IEEE Access , author =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.733862Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:f49634f1115b041c33684c2ba5288263a18b80c61940b25c42dc8d1e224f7dfe","observation_id":"766bef44-b4e9-43b8-849b-f56bf7b7ddce","resolution":{"observed_at":"2026-08-03T04:39:30.733862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.737965Z","title":"Advice to","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.737965Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:8ad617e584ce1b93e0acc0af37b80c93f0b859856c5cc39d3149d41c591e5e23","observation_id":"d63e0ac1-be9c-4eed-8225-f0d62014ec83","resolution":{"observed_at":"2026-08-03T04:39:30.737965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.741891Z","title":"Applied Intelligence , author =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.741891Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:4ae9eaaf902a341603e8eeb0c0905f19f6a256bf3d9d9811f94bf506633fa033","observation_id":"763a2c3b-bcc3-4a93-b075-69576f7a0dc9","resolution":{"observed_at":"2026-08-03T04:39:30.741891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.745384Z","title":"Frontiers in Computer Science , author =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.745384Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:12906f3319bddcc2a66bda5855e91d4297a7b2b82007b647d3dbb083a4858eff","observation_id":"0eb6dbf2-6d28-47ca-992f-176b78bfe290","resolution":{"observed_at":"2026-08-03T04:39:30.745384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.749576Z","title":"International Journal of Social Robotics , author =","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.749576Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:89e8ead73f159e7552890805456cff3f306f11a2232119697065011d5aee773d","observation_id":"8f962405-36d3-43db-af86-be6858457f23","resolution":{"observed_at":"2026-08-03T04:39:30.749576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.756277Z","title":"Analysis of","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.756277Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:815f3446de4d6e2ebe9529844a1a45237836c34e9d4092f700ee02f0513e6236","observation_id":"c7e68047-3b0c-4162-a5c2-ee5573d5470f","resolution":{"observed_at":"2026-08-03T04:39:30.756277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.759538Z","title":"Multimodal Technologies and Interaction , author =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.759538Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:d11b2e143bee1228e3f824d431faffae61d8a29ab306da100621ca681f75d07f","observation_id":"08808c1b-9707-47da-bdc9-b8130d669f69","resolution":{"observed_at":"2026-08-03T04:39:30.759538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.tics.2020.11.009","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trends in Cognitive Sciences , author =","venue":"Trends in Cognitive Sciences","work_id":"eb162d88-c95d-4cfb-98b2-7f0d1ebd799f","year":2021},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.762969Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:d239013666bb26122960283ec3234c8d3a92f1fb0649944b4839623999bd549b","observation_id":"cb74602b-fb75-4018-a1c1-72a8ffa45802","resolution":{"observed_at":"2026-08-03T04:44:22.332375Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.102676+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.102676+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.767177Z","title":"iScience , author =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.767177Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:79582649f276152956d42bda183233131ec1ef54e2c6f5fa2031981e37f5d9c8","observation_id":"c759fdb9-7b23-49b2-ba9f-5eaa6cf3527d","resolution":{"observed_at":"2026-08-03T04:39:30.767177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.770465Z","title":"Journal of Artificial Intelligence Research , author =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.770465Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:ab5905ed39b58b8dfc88a46af807a6914389d22ec9d15f68dabf5341c864cf2e","observation_id":"50facedf-7392-42dc-814d-530e0afdf03e","resolution":{"observed_at":"2026-08-03T04:39:30.770465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.774322Z","title":"Transformers are","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.774322Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:33488bbeab13a6d292bb4eba2fbc58dafdf6728c4e5a95f6034df26c0889176a","observation_id":"63418822-c77a-42ba-a1df-f2bd9c35d25e","resolution":{"observed_at":"2026-08-03T04:39:30.774322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03121","last_updated":"2025-06-28T20:24:20Z","snapshot_observed_at":"2026-08-16T14:37:21.057920Z","submitted_at":"2023-12-05T20:40:37Z","title":"Evaluating Agents using Social Choice Theory","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03121","snapshot_observed_at":"2026-08-03T04:39:30.777817Z","title":"Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.777817Z"},"links":{"cited_paper":"/paper/2312.03121","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2bfc020cb6b086fc2a86a78d0b5d07ff420a0d7f91017ac4441cc65f73e8c59b","observation_id":"a2e3a93c-482e-4e7c-a128-769964af40e0","resolution":{"observed_at":"2026-08-03T04:39:30.777817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10958","last_updated":"2022-09-22T12:28:29Z","snapshot_observed_at":"2026-08-16T16:30:38.484117Z","submitted_at":"2022-09-22T12:28:29Z","title":"Developing, Evaluating and Scaling Learning Agents in Multi-Agent Environments","version":1},"cited_work":{"arxiv_id":"2209.10958","doi":"10.48550/arxiv.2209.10958","metadata_source":"pith","pith_arxiv_id":"2209.10958","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Developing, Evaluating and Scaling Learning Agents in Multi-Agent Environments","venue":"cs.MA","work_id":"7a3b9793-559a-46be-8648-1d05c947a523","year":2022},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.781448Z"},"links":{"cited_paper":"/paper/2209.10958","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:d90b368f4fe459fae3bf53984b04c01b08f688cb0abad84d96c977a25b99f0df","observation_id":"013cc6e2-fc5f-43b4-b00a-c9d1ca894a43","resolution":{"observed_at":"2026-08-03T04:44:22.209340Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.280881+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.280881+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10458-024-09682-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autonomous Agents and Multi-Agent Systems , author =","venue":"Autonomous Agents and Multi-Agent Systems","work_id":"61263736-99ab-4576-9610-cdb6540646a4","year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.785712Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:a68e273bfc32e692214375e341c055aa049d59c4732b5f05285b360d2bdf6b66","observation_id":"82229c54-26b0-4761-9832-e67686709713","resolution":{"observed_at":"2026-08-03T04:44:22.123359Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.344353+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.344353+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.15167","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Journal of Artificial Intelligence Research , author =","venue":"Journal of Artificial Intelligence Research","work_id":"d6e15990-9c6b-44ee-b119-392325d2fc6e","year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.789290Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:e29e8a98baa337a16ec5b7190f469701bbf29524f799fd5bc7958c60dde6a1ce","observation_id":"1d8f45c5-c3be-4bd4-aee9-03c779c17589","resolution":{"observed_at":"2026-08-03T04:44:21.966221Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.400768+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.400768+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.793340Z","title":"Journal of Artificial Intelligence Research , author =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.793340Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:0f30157a7f0dfa1f365d39e53a99b570e5e6f4dbb3db177f129a9be7d890c15a","observation_id":"a9e4b278-bcf0-49c4-b9de-dde5656552a6","resolution":{"observed_at":"2026-08-03T04:39:30.793340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08727","last_updated":"2023-01-25T08:01:55Z","snapshot_observed_at":"2026-08-16T20:50:52.110799Z","submitted_at":"2023-01-20T18:47:24Z","title":"Neural Architecture Search: Insights from 1000 Papers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08727","snapshot_observed_at":"2026-08-03T04:39:30.797264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.797264Z"},"links":{"cited_paper":"/paper/2301.08727","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:52ca093d7cb186a482dea8e548d317f513d612548e3fea6e758632400b55ae73","observation_id":"31449dda-d39a-46d5-b32e-a85bc33eebba","resolution":{"observed_at":"2026-08-03T04:39:30.797264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.800852Z","title":"and Barto, Andrew , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.800852Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:58d744ceceeafaff6e07b9dce4aed9099be82a745dbc3845e1d52e8f8a354a64","observation_id":"b5f807f2-f37b-4114-ab1a-3798a692f2aa","resolution":{"observed_at":"2026-08-03T04:39:30.800852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.803950Z","title":"and Barto, Andrew G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.803950Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:a8b850e076c9a514a3c820e44e214f0f97c9a048e07dd7a343c5b0681aed3117","observation_id":"19a06b44-d4d5-48c1-8b96-26123e292310","resolution":{"observed_at":"2026-08-03T04:39:30.803950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1098/rsos.230539","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Royal Society Open Science , author =","venue":"Royal Society Open Science","work_id":"bd0aa31e-5dd4-4e09-95ae-5b344dfa376e","year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.813042Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:125c9b8a28539d01855e2eeb41d51fb63064e7b4f4f66d6e573e55ff553c7fa3","observation_id":"9894208b-911b-4749-8fe2-e5180db8bb08","resolution":{"observed_at":"2026-08-03T04:44:21.806905Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.564164+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.564164+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05162","last_updated":"2023-12-08T16:42:15Z","snapshot_observed_at":"2026-08-18T20:19:43.386956Z","submitted_at":"2023-12-08T16:42:15Z","title":"A Review of Cooperation in Multi-agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05162","snapshot_observed_at":"2026-08-03T04:39:30.816292Z","title":"and Islam, Usman and Willis, Richard and Sunehag, Peter , month = dec, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.816292Z"},"links":{"cited_paper":"/paper/2312.05162","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:3473a87a39aafe42334d9305429b2791795516e7bb9f15ea3884c2b986866742","observation_id":"21b12909-a796-4a19-a9a3-5e000d6edab9","resolution":{"observed_at":"2026-08-03T04:39:30.816292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.820337Z","title":", month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.820337Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:35f06173d1411d242f7d9a9b993601987168630b16316bb30c8c8faf75b78dd0","observation_id":"63bd049d-e006-4ea7-84f5-e410c8be53f5","resolution":{"observed_at":"2026-08-03T04:39:30.820337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.823576Z","title":"Mediated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.823576Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:cf334fcd644d9a8cf161290c4f14f7af2769f9840e75633f9a3c2ec7a4f73204","observation_id":"6498bee1-836a-4139-ad8a-e68c6e9b103c","resolution":{"observed_at":"2026-08-03T04:39:30.823576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10458-024-09649-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autonomous Agents and Multi-Agent Systems , author =","venue":"Autonomous Agents and Multi-Agent Systems","work_id":"5fde7a6f-1f28-45ae-9940-18a3f4c15aff","year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.827182Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:6b6386c0924f5f23ffd0d62f492afa2672a280630057368b11088c5ac115a344","observation_id":"5c2cf02a-971c-473f-8edf-f60a5a12e900","resolution":{"observed_at":"2026-08-03T04:44:21.678380Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-08-03T06:19:17.75463+00:00","source":"paper_reference_links","state":"open"},"event_date":"2024-06-07","event_type":"correction","notice_doi":"10.1007/s10458-024-09654-9","provenance":{"observed_at":"2026-07-11T03:00:36.460696+00:00","source":"crossref","source_record_id":"10.1007/s10458-024-09654-9->10.1007/s10458-024-09649-6:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.830453Z","title":"Cognition , author =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.830453Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:8f6ce0da0a2d22638cd80e56f6b76a03890fdd23ac69f7dd06593a026e0dab65","observation_id":"9817d800-dc4a-4ad2-8ebc-132e96241b54","resolution":{"observed_at":"2026-08-03T04:39:30.830453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.833868Z","title":"and Everett, Richard and Weidinger, Laura and Isaac, William S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.833868Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2e1ae4193fd6f9c5c1e78938bd7baef2309a0aa614a3fa92059196b588f32e8b","observation_id":"f2eee9dd-060e-4613-97fd-9fdbe0974ca5","resolution":{"observed_at":"2026-08-03T04:39:30.833868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.838430Z","title":"Cooperative","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.838430Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:e7a42018573bcf782cb71d9fb283507811ca382201144bdc5c0ad14bd26b0ba0","observation_id":"60ba10fd-b2c5-4b05-b302-883f468d5c08","resolution":{"observed_at":"2026-08-03T04:39:30.838430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.846473Z","title":"IEEE Robotics and Automation Letters , author =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.846473Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:f3c3b477a0f05ba942927aa2842297767450eb18042abd23ce959536976fdb6f","observation_id":"3ee80319-2cc3-4ffc-9cbd-c32069438a0a","resolution":{"observed_at":"2026-08-03T04:39:30.846473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.861005Z","title":"Current Robotics Reports , author =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.861005Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:d4f5032b9e78f08e049c6535e379dcbdeeda11dc0804211fe27021f21bc9411f","observation_id":"2141b031-3153-4c47-9e74-12baf8384c26","resolution":{"observed_at":"2026-08-03T04:39:30.861005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/scan/nsaa040","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Social Cognitive and Affective Neuroscience , author =","venue":"Social Cognitive and Affective Neuroscience","work_id":"c0e639b5-538c-424a-9717-eba46d7d512e","year":2020},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.877323Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:47ec850f8ab977a00d56ce42a0fb8f6877c5d6b560f1a6b0bb0ba05cd680bdbc","observation_id":"944e8b32-f415-499c-ab9b-dde16231b2a5","resolution":{"observed_at":"2026-08-03T04:44:21.512071Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.844761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.844761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.tics.2021.09.002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trends in Cognitive Sciences , author =","venue":"Trends in Cognitive Sciences","work_id":"ec1addd2-c8da-45fc-af93-d6736960b52f","year":2021},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.893139Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2d296f9bdf97d8946a987f1135a6b0720757b186e2d53dd07218b0cdd95065e1","observation_id":"0a0f1814-5932-41ea-8f1e-0aee02a71c29","resolution":{"observed_at":"2026-08-03T04:44:21.381159Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.908061+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.908061+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1155/2022/2341898","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Computational Intelligence and Neuroscience , author =","venue":"Computational Intelligence and Neuroscience","work_id":"4a0b54da-75b6-4237-b8be-8863fc1792a6","year":2022},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.905584Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:7273057de7ab254d8c164cff3b8249a3f2fdb28b6921ea9d7cf15767cab7cf07","observation_id":"a6865620-a6b8-4435-8907-a69076c020d0","resolution":{"observed_at":"2026-08-03T04:44:21.205263Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:14.969843+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:14.969843+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.915570Z","title":"Adapting a","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.915570Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:203e3cd65beeaa6ba1b675375038a82aeec523c6967262cc6d9aac9eb8574706","observation_id":"55af0887-b944-430a-82f4-8788f7724e23","resolution":{"observed_at":"2026-08-03T04:39:30.915570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.931146Z","title":"IEEE Transactions on Affective Computing , author =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.931146Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:030ffbb74ec76847d517aba5939a7b88be9bba02e1050d247ee8ccaefdd20ae4","observation_id":"bc90fbd5-be26-4c4f-8889-a23294a9334e","resolution":{"observed_at":"2026-08-03T04:39:30.931146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.948606Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.948606Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:8f93af0ace677f9a65e004e885b7a861f9daaf66763d0a6cdcbe39cdf7acc775","observation_id":"d1fd4bd7-c2b8-46bc-b200-c7178fe8802a","resolution":{"observed_at":"2026-08-03T04:39:30.948606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.960528Z","title":"Metin and Yemez, Yucel , month = aug, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.960528Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:1bbd72ae1aca0e2c76764c53273792c913283a10024a461604192570d2b59670","observation_id":"e3abd1ed-5039-4116-9bfd-306a0b9298a2","resolution":{"observed_at":"2026-08-03T04:39:30.960528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.972625Z","title":"Metin and Yemez, Yucel , month = aug, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.972625Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:bf8f3edd8a6678cb4b098e094513a2c7f384d3a26f70417999ecb0a8e4b88c85","observation_id":"26e52079-457f-4d75-b913-1c032f5ac3ab","resolution":{"observed_at":"2026-08-03T04:39:30.972625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:30.984006Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:30.984006Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:abc022d3e2dc59795c1392e02ba07ca8e32cdef3437dad20facfce4a77224dda","observation_id":"97dbda7e-315a-49f6-8356-7dd4b3812788","resolution":{"observed_at":"2026-08-03T04:39:30.984006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.060609Z","title":"Human-to-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.060609Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2b792be0dbc4ac29234226603310c2da9d38a4dae00107245918cb1cbf57f4be","observation_id":"9e32b8c5-426e-40cc-91f6-084daaee667c","resolution":{"observed_at":"2026-08-03T04:39:31.060609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.177488Z","title":"IEEE Robotics and Automation Letters , author =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.177488Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:5ca7e2c46909e0d8c38b0666861442b7f7e874fc5fa9cdedba7ad4564d6d02f0","observation_id":"eee5a56b-dfad-48f7-a4fd-52b13a7b474e","resolution":{"observed_at":"2026-08-03T04:39:31.177488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.289728Z","title":"Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.289728Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:cbe7736c4bcc31dd26211f7f18f7b865760b5bf79b35c021c6d5dba09fa5c76c","observation_id":"80d2053f-f062-430e-813e-56aed56d01c7","resolution":{"observed_at":"2026-08-03T04:39:31.289728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.385547Z","title":"Modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.385547Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:05e1e2ae6750b1bf0151c80db137c9a56f257355f0548fb461d53159913cf3cf","observation_id":"d2362b2b-3b77-45c1-96b3-14db60f9121c","resolution":{"observed_at":"2026-08-03T04:39:31.385547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-022-06273-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Learning , author =","venue":"Machine Learning","work_id":"32aba90e-e5c1-45d0-8cd2-73c597275047","year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.481959Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:35cd6efe6a0ca276926fdee8571ac2459a488b253dfaf4e2ffbc80fb896e7ac5","observation_id":"398d1d3a-0f5b-4192-8465-e7616806cbf7","resolution":{"observed_at":"2026-08-03T04:44:21.076143Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-08-03T06:19:12.027079+00:00","source":"paper_reference_links","state":"open"},"event_date":"2022-12-28","event_type":"correction","notice_doi":"10.1007/s10994-022-06298-2","provenance":{"observed_at":"2026-07-11T02:56:29.207212+00:00","source":"crossref","source_record_id":"10.1007/s10994-022-06298-2->10.1007/s10994-022-06273-x:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.547361Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.547361Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:72e9dec9fcf1fee0d2a51aa17ea39c8223bd591994db3c80ca28e3595796fdea","observation_id":"aac3b22b-e924-4590-a1fa-6a6bdd1207d3","resolution":{"observed_at":"2026-08-03T04:39:31.547361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.664294Z","title":"Emotional","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.664294Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:3dee3cd62af2e2a67266885a78162e9551b389951e66148002a3d19351427e6f","observation_id":"dfc7ef3b-3178-45c8-924a-2f082fa68de0","resolution":{"observed_at":"2026-08-03T04:39:31.664294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.667664Z","title":"and Islam, Usman and Willis, Richard and Sunehag, Peter , month = dec, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.667664Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:f133e38051e20a4f3e504a6e2d840bd03b508b0fac28fe2f6522bfb21bbedefa","observation_id":"5f42a059-110c-4e68-a3ef-896b353f0183","resolution":{"observed_at":"2026-08-03T04:39:31.667664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.670843Z","title":"and Gemp, Ian and McWilliams, Brian and Duéñez-Guzmán, Edgar A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.670843Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:3a04092459d0ef603b91008841ea3488e8a29d4ddc47a8cc665c5aa8b0522de3","observation_id":"58d7e322-5396-48c8-a347-3319934c83fd","resolution":{"observed_at":"2026-08-03T04:39:31.670843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.674019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.674019Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:7236675d7a73a35ba1f80751d46c72c54aafb0f993db47e61d7bcdd97a5ad7ac","observation_id":"6c916df2-d1b0-4243-9d6e-f782a21519ef","resolution":{"observed_at":"2026-08-03T04:39:31.674019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.677004Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.677004Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:4bf08e8795635b2b3800cbbd9ca486a579111ab75abc4f3801c16ae99493422f","observation_id":"10f9f5b4-8f97-4e32-b704-623d55bcffed","resolution":{"observed_at":"2026-08-03T04:39:31.677004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.680086Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.680086Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:d175d11060f22374258678cf870cbcf81e9291a7f5e7090c3184bffea7d03d2b","observation_id":"57260140-fee5-4958-bad2-e8a50ee4028e","resolution":{"observed_at":"2026-08-03T04:39:31.680086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.683227Z","title":"Autonomous Agents and Multi-Agent Systems , author =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.683227Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:2ed71b2030faf7047ece938b0d8fe90d77050af32a3ae927ef8cca9d0c350f37","observation_id":"480e41c0-4ef8-4e12-acaa-0ace24f19522","resolution":{"observed_at":"2026-08-03T04:39:31.683227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.686200Z","title":"Bradley and Sadigh, Dorsa , month = apr, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.686200Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:0456a7ec5f9b3fd176e4164187ec45e3674d4a9542560ce147c2e713cfa6a831","observation_id":"a5a6ac41-2cdf-45aa-890d-506b7065f227","resolution":{"observed_at":"2026-08-03T04:39:31.686200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.689071Z","title":"and Fidler, Sanja and Torralba, Antonio , month = may, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.689071Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:0a24faf60a45dac7509f0a3a0ee8a075fd213a877a44fb0b85643b866a9e7a15","observation_id":"9ffd6a80-e9ba-40a8-8103-9a3c3a09fd14","resolution":{"observed_at":"2026-08-03T04:39:31.689071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.691892Z","title":"Promptable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.691892Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:6c3ba20fa90455b13717f623546ea2cf7d053a517f47fc30b4796bf47e35cffb","observation_id":"99fc0100-028f-4dc4-b98e-931f6000a011","resolution":{"observed_at":"2026-08-03T04:39:31.691892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.694946Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.694946Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:fb5b9783e11b993428c0573e3d3ae77ed39d710675ed71ed85a34d5bf200b9c1","observation_id":"86f42e63-cc98-44bb-a265-3c4581a50234","resolution":{"observed_at":"2026-08-03T04:39:31.694946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.697972Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.697972Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:15bf179f1a92a321afaa163eeef7ff3cb79923ede58d92073223eec1987c50c9","observation_id":"55496758-f7d2-46bc-a06f-36b1c5706af4","resolution":{"observed_at":"2026-08-03T04:39:31.697972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.701073Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.701073Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:5a9f8a4dcd5eac8679d0adf1b450079b0c33e01cc4181f4c48d4b27f64546df9","observation_id":"4a0f04da-3b3b-41a8-b155-4ce8e945408b","resolution":{"observed_at":"2026-08-03T04:39:31.701073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.704035Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.704035Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:34bd440db72ab7a957c22c005373953c42a69cad7920cfc5119d74ffe68fb0c8","observation_id":"a3936488-a1cb-4a90-912f-d7bf327a38e6","resolution":{"observed_at":"2026-08-03T04:39:31.704035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s1389-0417(01)00013-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cognitive Systems Research , author =","venue":"Cognitive Systems Research","work_id":"4f41941d-79d5-4b1e-9fc8-5692e05b817b","year":2001},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.707129Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:a31617c775de8a4dca997d719a13278d5bb1c72d6d5c519925c9bd4e74c5c1d2","observation_id":"8e997296-835a-4343-b4d5-2f0a78e07893","resolution":{"observed_at":"2026-08-03T04:44:20.901824Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:15.155805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:15.155805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:39:31.710251Z","title":"Artificial Intelligence Review , author =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.710251Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:30bc5dcf9721c1fbfaab60d00fa8cd8a3a8787612f7881c1ae7f95225d08c1dc","observation_id":"0f55f6cf-6310-4e71-bc2c-05897c0bd980","resolution":{"observed_at":"2026-08-03T04:39:31.710251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3627822","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ACM Transactions on Intelligent Systems and Technology , author =","venue":"ACM Transactions on Intelligent Systems and Technology","work_id":"d0a69b15-f345-4cfb-93ae-b664dd34c78a","year":2024},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:31.713492Z"},"links":{"citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:3a83058d311a244da9751190327269e692e4712059dbadada926fab505e91fa7","observation_id":"0f746c6a-e146-45f4-8560-67a2c894362d","resolution":{"observed_at":"2026-08-03T04:44:20.819365Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:15.312316+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:15.312316+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T00:00:43.308138Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":3,"unresolved":81,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":297},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 297 outbound references and 0 inbound Pith citation observations for arXiv:2607.29559."}