{"as_of":"2026-08-05T07:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c80d8fea4e03f7322295da3f187d89d46e73ba813565959bd6d489ff2e8bb6af","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:13:07.480013Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00367/citation-record","integrity":"/paper/2606.00367/integrity","json":"/paper/2606.00367/citation-record.json","paper":"/paper/2606.00367"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Shah and Martin J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:5ff93fe7b2fe09acaf95ea276364a4bdae2304c357e6ae05ea7e053388b2cf12","observation_id":"5cb98f12-076b-4673-9e14-f2fa72c0f437","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:44eb97d012afb56afee63a1e8e6263a1ed241a7642e90d5a35e2e822f743ea54","observation_id":"e38bb2ac-ca24-4309-981d-2bb97ce077af","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"arXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:8f42a4a0b1d504df43be4868b1d6fa9302b10ae253a02837ab5862da3879219a","observation_id":"fe76f9a0-c91d-45c9-92f4-9cc96da2f170","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"May , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:e2d708bc19252d380afb753b9704c4270487c7ca0de4116253e50ee0def5c609","observation_id":"26cd1e61-eae6-4725-bfc0-5ae2f938bab0","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:3174309ff88583034e069718b41d77f4861c289de23b52a11a87b75ceb68f0f3","observation_id":"b5663762-6719-4f93-aec8-51e38c2d6fc0","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Theory and decision , volume=","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:8b31b5f64465fd82910583d050044af3091984de6db90c4564a56a0d6ccc24d3","observation_id":"6041a12a-e0a6-4968-94b4-712a68ce32f4","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:736e8fda5d8800d75b31696cd20141ae73c92c8769534cd3a98679b937f3683f","observation_id":"58c5b4ee-1002-432e-816e-b7531e30475e","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Reinforcement learning from human preferences within the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:f0de99f8ff5aed644d95ebe4bac6b186952f435469bb76e01c15d98c5806a029","observation_id":"c5bedb28-f743-453a-b0cb-49f71478f336","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Papadimitriou and John N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:b8052a0d4ef7f7700839f8e7f1dbe870e4b0028cd2f40cbd925f8e0b3f0b2bba","observation_id":"a78ec99c-cb77-42a1-a4e8-e093551be050","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:001fcad9c719724049fb05986f8b0fb4d67c1f31363b934b11af991802316400","observation_id":"e42fce6b-881d-4846-9a45-12dd4e26bb80","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"and Van Roy, Benjamin , title =","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:af2782d54302fc911f37533e66382f08687f1fab5f6582b3003357bc006633de","observation_id":"369e9412-b1e9-4475-8a90-2495e08c878a","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"A decision-theoretic generalization of on-line learning and an application to boosting","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:d62ae0c7c02b9a52568da433a15ffd44ae78521c5b9197eadcacad67e64f24f9","observation_id":"89237b8f-e6a6-44eb-a3b5-947694057ff9","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:1ef32cd9b02b402ab3de8c8f6cdf2687e4a05ec32023e32e9f199ed38e0bc500","observation_id":"8d3117e8-9a6f-4f0e-9be4-42450d8d7d7a","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"and Lowe, Ryan and Voss, Chelsea and Radford, Alec and Amodei, Dario and Christiano, Paul , title =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:a752f19f822951ddf046e2db654db2e641ebcd5bab35f7cf5eeeea3189d92ad7","observation_id":"bada31c1-e44f-40ec-ab28-fdab3b64f101","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:771f8d4cddb64484991d8ee0c979b7ca8001e543e498fc28b7c1b74accef6965","observation_id":"0c39a32a-d782-44ca-b8e0-b2c7355551ca","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":", title =","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:472318096b4b87857a8bcb9ddb84ecd23a24570fe9be526ba2a498966180d4b2","observation_id":"72897258-17e2-4c1d-9206-d7a7a02ae573","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:1570e72ea3883652fa3944e51797eb72cc0ed8fef2575d613534a8a57c5fd9b0","observation_id":"15bf99a1-2a47-49e9-99e7-5d7ed4ceaeda","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:2251f9dfb8d0bd40be64fb2f8bbc21cd6ccebc79534f12459a7da3bd4d4a3ec9","observation_id":"6840f376-735a-403d-8706-9cd30ea61376","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2012 IEEE/RSJ International Conference on Intelligent Robots and Systems , pages=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:4d8c72de3e0ed27212a366e15bd48efe90a8fb4cceeb2334e6b448f1542d3d5c","observation_id":"e937cf59-00c9-4f58-915f-ba8f0c385e3f","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2025 , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:ab2300d590e66966d49a7347dcc3e78f01635e18078a76355332e20c1c9bf538","observation_id":"385ddec5-7ef5-422c-8334-e7b13d79a1a5","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Online Markov Decision Processes under Bandit Feedback , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:aa82d645857383aafd09ef9525b208f5b354bdd23d4686f5d08047049720ccb2","observation_id":"f8bedf18-9abe-4c4c-b2ee-2986d93bc196","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2025 , eid=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:3b605ada9a4dc47ed0851c059f367cdbc832a7ad8fc901afe2999830afd36917","observation_id":"b8009213-e42e-42eb-9d71-a4054019fe36","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Econometrica , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:3564ace17afb2b14150a19771e18950c0f21d42d1b0cf2c0d815d0a508190efd","observation_id":"f0df10be-09f6-41ea-8a80-8facc9461300","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"1982 , author =","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:07ac45812b50b9a0b354ef28fb0eab90a2fd75c404a4974ee32209919ca65226","observation_id":"407f1cd8-225d-4db0-b97f-3384d5832503","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"1984 , author =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:5b61ecae5fb38b0e4bd7495db424d6226367b29444f939daecb8c1e2c2b70eb3","observation_id":"a6e77f40-0154-4ab5-a1cc-e22a27d8e775","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:2c0d691f8111672464baaabf4db600a93909d6715cb9b2d2338eb556e896367c","observation_id":"0bfbc581-7c10-4682-b07f-f0c49698fe76","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:ccafe2af95d0fafefc05493f5a0a09a26668e0996506004c666a22226770dd18","observation_id":"239aae29-1fb5-4f37-ad83-9a2c664f4858","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Prediction, Learning, and Games , publisher=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:005f18f4fa1aee5fa0ea4dfc9163ce1c0c5c82a11979ddd1dfc75aadafcebc85","observation_id":"f305c3d4-ab44-42cc-adb3-f58472c0cb94","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Pacific Journal of Mathematics , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:dbbeec148e4e4401b25fcc6c93b5622d2a8e7d069a71d7a00c11a19b742b7857","observation_id":"89bb9e37-08f8-40af-84f8-320f53b17513","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Theory of Computing , volume =","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:25f8bc1952308505803aef1ed462b9eb0600b0c00e6a8b0dc109068ee9798207","observation_id":"1355fa2e-9810-492c-9a2e-675667efd0ae","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Araújo , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:bdfe6dcdfafc3816792a8524ea408b1f47eafe5243857223a784bf5037fd8e5e","observation_id":"176c218c-c04c-4d93-b19d-70d86b0f4bf3","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Deep Reinforcement Learning from Human Preferences , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:2d784320f7dbb65af81a7d2b84e960761e91e8c4ace8c00e93baeb44770e61c7","observation_id":"bc2f9af5-260d-47a1-9ed8-2915d8dc6f08","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":", journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:1069be53d0756c180b63c5ff8caebce8a225d72be2591177f5b7ec0063b398ac","observation_id":"67793272-22ff-4676-9f88-c0779948146f","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"ICLR Blog Track , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:3daadd7fe44fc634b9d0d8550df6525fa090b2501dcca6da1d82c92e17c9e3c9","observation_id":"2ce2ddfb-1c1e-4f3a-85a6-4be06e2199ed","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:6b0d4c0884e54d5cde92042fd8702f6e35b2691d9ed31d57e77a4c6087f211f7","observation_id":"8f33edf5-ea64-443b-a769-003ae422136e","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Iterative nash policy optimization: Aligning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:95c9ed36b2c511bddd3d7dc8966d4ec6d57b9de727ec7f1ffae12e4196a18036","observation_id":"df928353-6c78-4903-a45c-1dd1155b65b7","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:2229ef4ac733b7c6655f0695f7bf6fe316cdbbb6118708227ec010e779ef179d","observation_id":"3f14cae9-e292-4ac1-912f-61f91fd583fb","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:55540839d73aeb9a50ae0dd20c42776e22ce516a4387b7152bb78440c538cca3","observation_id":"f88d88e9-0f91-4b65-8b9b-0143a0fea496","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:447f2b570e4fbb37ceb6b7a058c5c1905c0a46c9dcb179f723e9cd5c83a196ea","observation_id":"1022f6f2-b343-4f32-ae25-905f92713a3c","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:c56848d38c15372a9607d7b139532a7c243c10155715f652b525ade058b03a69","observation_id":"b6aefaed-b482-47f2-ac07-3ee7c2faa879","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:0d52e4fb0a38906d7019ad7e3d85f01bdcb018e8cc01c5fa1d2e2cf1110180f8","observation_id":"af831697-eba1-422e-b551-afa610766027","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:04ac311db1c2e2c68e48dc7697592b2cb13f05f577015e59fd257bda08939a86","observation_id":"2e96537d-b3ad-4b77-b04c-0cecfb2a6152","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2015 , booktitle=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:1fdeae21a1d70257d26bc49e0786e87d36e8b3c3cefae3d22801268d17dad78f","observation_id":"04a5b9d9-e1d7-4c48-9015-32b4cee2f23d","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2016 , booktitle=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:b23d06c07ac1e25a139512a1fe36f1373451b893cdb89bb26cb4e1b8ed6b3aa0","observation_id":"f3a0b3ea-f36f-4139-825c-3676fe4cc2f8","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"arXiv , eid=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:8399553b645254805f1f240dfd133ff3ea83a4e53d0e3be406aa57483f6fee24","observation_id":"b2bd2f4d-5513-4012-b1af-3afdb5e9d07f","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of The 28th Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:35b1ac926997f1b26895e27036a64d4cd390ec0ad2828e1703c4d47d5a0b146e","observation_id":"0a116ac5-3549-410f-b008-d0c919bf1ba7","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of the Twenty-seventh International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:e4f4f612e8f5b2ce09c4ec1e42a85c8471567aa00345adb45223c477d68ae9df","observation_id":"136f7d0a-4797-4591-9fd8-ec4884eac504","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:bcfd06b0acb4e2e3fb2e359829894890d8252a3ae2d83154a6bfc4329a775059","observation_id":"f2453679-a98a-40f0-9e0c-d84a3ce0197a","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:2a0d5a08179e909a8b85947a6d80a7ce3e00dcace2735f53dabea46337ed7aba","observation_id":"3142b86a-bb7b-47ea-96c0-fff7883266d7","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"arXiv , eid=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:c4e36591a295555f3119d124fb192ff55d3b19b71cae389d76d94a92f4e0c498","observation_id":"785776f9-5346-4058-a937-e8fe2384e564","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"1997 , author =","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:919b5406ec461bb24ba7e00a3e042ccbbb2645d90e1dd72ae611893b150879e5","observation_id":"02d45875-3276-49f0-aaff-a1db0c12a184","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2008 , author =","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:ce093b3dadec7658a849f6107c1fa570abca2005dec0dde890824ec85585bd81","observation_id":"8c292762-782e-42a8-bcde-9a3a2b1029c8","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"1999 , author =","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:4cf197aff273413c67ce3f54c13f3de39c32ceb8edabe7a892c82071ef55b0d4","observation_id":"e77d0791-d7d3-4d66-88d5-4b3deff0bac1","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of the 31st International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:1eb2e64bdd304f4564cae9307e5b848d50059ccb13941458561962702dbfd745","observation_id":"8b0727b4-0719-4f6b-ba95-ffd1a16a01ea","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:bfbf0191d3ecbfcca6de37dc5158b4554adfa4bd3a0e10bca724e0090e5c150b","observation_id":"8dd627c9-62ae-4831-ae2b-0466744ec6a3","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:5be8013a107a98a7ba915f2c3aa24dfdaa093d546394e36c1de5b77f3bbdba2e","observation_id":"f5667c41-439e-4f37-be55-b497ca8a0267","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of The Twenty-sixth International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:be02358c8e07a85486ceb68164e55b34b3188a1122eb93a57afce7b155df7d71","observation_id":"16e3ce12-fe2b-49c8-96cb-f5dfa90f0611","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:1b2704f28abe151022166b2df5d818c33e296879bc01cd1b9ed4d884b4d4b9a6","observation_id":"c145db34-3c16-44b5-aebc-ba5729c9e32b","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:2d67ed9820240f793a8e6c8026b882b136fee9eecb85578ac90c43fcdfed8a82","observation_id":"e14bfaaa-6504-4c1b-a462-84ade81ad2cc","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Jordan and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:d3e0df1d6cedf7bae4374b167f835b31a11ad908475f62a1bee20317de6d4e91","observation_id":"0536c427-bf36-4051-9d0f-4ed1d471318d","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"and Barto, Andrew G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:276417e09c7990892f4a90b4aec7dbac06b3ac431921f1bd51022b7c07fd225e","observation_id":"a3cca256-fe0f-43ff-92ec-78ef143bc704","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"Proceedings of the 32nd International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:6076a1e7841c3b451b32cc4090067f64c7db7924f72ee7365efac37ee886e4c9","observation_id":"2619c0c2-f68c-4c18-93b1-d4406cc3650b","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:07.480013Z","title":"arXiv , eid=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T23:13:07.480013Z"},"links":{"citing_paper":"/paper/2606.00367"},"observation_digest":"sha256:b6db4618db11d45d9144c1399a29c5ba7df271dbd9f32990463ac3001add3954","observation_id":"9b18b520-aeae-4bd4-a653-8c884729df8b","resolution":{"observed_at":"2026-06-28T23:13:07.480013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00367","last_updated":"2026-05-29T21:16:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:16:25Z","title":"Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2606.00367."}