{"as_of":"2026-08-10T17:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a758dd5a6df8eb9705fc573f8bd7da83f9abfddcb0144bc589395efb56aee9a6","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:53:13.730009Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12529/citation-record","integrity":"/paper/2506.12529/integrity","json":"/paper/2506.12529/citation-record.json","paper":"/paper/2506.12529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.634096Z","title":"Sutton and Andrew G","venue":null,"work_id":"6ec7273f-03e3-4d0c-a254-c7a56eb161e7","year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.574686Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:05523bc93ae9758f2b54fa10ba4955e2b5f7966c2774373e8a294b0679623382","observation_id":"a838ea7f-1367-4cab-ade4-ff13cad9272b","resolution":{"observed_at":"2026-08-07T00:53:14.636568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.626716Z","title":"Reinforcement learning can be more efficient with multiple rewards","venue":null,"work_id":"49397a6c-4295-4b25-a19d-c90e7cc23eb8","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.577558Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:066e1fbc08e74c477ddebdec7563ed0bfcd931264dfc42a34dd6c175d036ade4","observation_id":"e41adb7b-fc05-47b2-8087-650acdee650b","resolution":{"observed_at":"2026-08-07T00:53:14.629294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.580172Z","title":"Learning Agile Robotic Locomotion Skills by Imitating Animals","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.580172Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:02c3b8bd1abb41c14f70aae4ef0f288567f3ca09ab66e3ef71ec742f73948516","observation_id":"31528ee8-6aa9-4fcc-830b-25e50396a312","resolution":{"observed_at":"2026-08-07T00:53:13.580172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.583522Z","title":"Deep object-centric represen- tations for generalizable robot learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.583522Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:43de0facec4a041dbe4d37f17d8af3eef41a1321c00f12ca17f42e4785819e2f","observation_id":"668de56f-1921-46d4-b2ec-7ffbe1be87e2","resolution":{"observed_at":"2026-08-07T00:53:13.583522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.619931Z","title":"The ingredients of real world robotic reinforcement learning","venue":null,"work_id":"50187397-04eb-4634-9298-5e66501ffc8b","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.586670Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:7e2c4f74a109dcb6984a954f2fac34e3953db8ee528e76744c7c8a21325e5f40","observation_id":"b89ad36b-5273-462d-9fa7-3068b8804939","resolution":{"observed_at":"2026-08-07T00:53:14.622631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00957","last_updated":"2023-03-02T04:24:29Z","snapshot_observed_at":"2026-08-01T17:39:47.889401Z","submitted_at":"2023-03-02T04:24:29Z","title":"Preference Transformer: Modeling Human Preferences using Transformers for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00957","snapshot_observed_at":"2026-08-07T00:53:13.589096Z","title":"Preference Transformer: Modeling Human Preferences using Transformers for RL, March 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.589096Z"},"links":{"cited_paper":"/paper/2303.00957","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:0eb51cb9fa925b3fa7b04a017d12574d466bc921c290ba9b23495a2dc018e9e7","observation_id":"1b95cad8-1d9e-4eea-b430-9a45b1b06e2e","resolution":{"observed_at":"2026-08-07T00:53:13.589096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:53:13.591993Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.591993Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:99f48cbd2100284a3209ceb75014c82c780b14a205353800698abd336edf4dcf","observation_id":"1211a9fc-d637-440a-8732-934998ae1c9a","resolution":{"observed_at":"2026-08-07T00:53:13.591993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:53:13.594860Z","title":"GPT-4 Technical Report, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.594860Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:ddf16d9a5196aa8755a8eb778cc95786c5dde9da1a363d338b729cc03e8fe418","observation_id":"bcdaafa4-37b0-4089-8eca-e979692aa58c","resolution":{"observed_at":"2026-08-07T00:53:13.594860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.612374Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"f7ba15f9-617a-41c9-9ce0-f7006116a352","year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.597295Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:5a4e3e520649b7e712611f5df8bb0544a52533f56fedfe4ceb30070fb0a72842","observation_id":"69641a7f-1abc-4504-9b55-3c54a6ceec2f","resolution":{"observed_at":"2026-08-07T00:53:14.615042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:53:13.599621Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.599621Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:28cbb5bd7204d44d465e7404ec182a883069a0668e8c04b9c62fde1ead0efa05","observation_id":"19b879c1-f247-4979-b6df-efeccc565ea6","resolution":{"observed_at":"2026-08-07T00:53:13.599621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.602307Z","title":"Active Preference-Based Learning of Reward Functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.602307Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:605e5b07ed3cfb2369590bfb5713597a41c0150f2917808795f7db811bea6741","observation_id":"a2f8fbe3-ce5d-4f95-a555-30270e9eab9b","resolution":{"observed_at":"2026-08-07T00:53:13.602307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.605833Z","title":"Deep Reinforcement Learning from Human Preferences","venue":null,"work_id":"83f7d705-c33e-469c-a88e-60bc1a319e40","year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.604747Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:0b1f32e6b424cada95a08652180df76e61364594de604af01a0664c3b2735735","observation_id":"ca135057-2688-40fe-a535-3bc88ad74e26","resolution":{"observed_at":"2026-08-07T00:53:14.608347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.599101Z","title":"A Survey of Preference-Based Reinforcement Learning Methods","venue":null,"work_id":"8a95834f-db96-4b71-b8e8-fde757e84ea7","year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.607066Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:4990083ed48b34356c61d383dca3e1a7fee37d0c9d7ec2239d8fe7ee4160cffa","observation_id":"f60f215e-05b2-4d97-b993-3dbe38972c4d","resolution":{"observed_at":"2026-08-07T00:53:14.601692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.609596Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.609596Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3e619e3378e6db59d9558beae0d17f99881c335295e969fe16078f244fc4165b","observation_id":"dcc01f40-2cf0-4b44-9e41-5b13da365c11","resolution":{"observed_at":"2026-08-07T00:53:13.609596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.592120Z","title":"Smith, and Pieter Abbeel","venue":null,"work_id":"f54374df-71b9-49a3-89bd-82e8f209c3c4","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.611610Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:66a8fbc1c9d000d6c8ac3107ed3f454f53e7e2e543e10ff0904623ed61ebd9cd","observation_id":"bbed6be8-6b7e-4898-b8a2-4b2515e6542b","resolution":{"observed_at":"2026-08-07T00:53:14.594628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.577145Z","title":"Few-shot preference learning for human-in-the-loop RL","venue":null,"work_id":"fb65bcc9-542f-4c90-8473-0b8afe0fe3d4","year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.616579Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3b668ed144e7c2d9b31b433d2fe991230cb819adf0b641eca231c3c685129e3e","observation_id":"5a1f93fd-7264-4d23-8023-83386e640017","resolution":{"observed_at":"2026-08-07T00:53:14.579789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.570116Z","title":"Bradley Knox, and Dorsa Sadigh","venue":null,"work_id":"f0d73b80-bbe9-4cfa-8459-bccbf0b3e4b5","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.618745Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:6037e89f4b720f0db8d117c609863382589b31fb32cde0168562cec6c6c247d7","observation_id":"886092de-c884-4349-aee7-dec74b9d0023","resolution":{"observed_at":"2026-08-07T00:53:14.572904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.556912Z","title":"Inverse Preference Learning: Preference-based RL without a Reward Function","venue":null,"work_id":"0e7e4e9f-19e9-4999-a4b7-d357db90e1c2","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.623886Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:bcda148a6d9dc8c5cbfac93bef31d0773b5acf7ef2bed9ccefd0cfb661e7bf5c","observation_id":"aa775772-5afe-4056-bb72-43b3df819895","resolution":{"observed_at":"2026-08-07T00:53:14.559555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.549957Z","title":"Direct Preference-based Policy Optimization without Reward Modeling","venue":null,"work_id":"2bf8da22-5a25-4530-914f-4a1b9ebb1d77","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.626123Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e520982e69c1f88643120c507ac3858a5a1ffb6e78d11ccf1a0213d1ddb00e10","observation_id":"327d9590-55cc-4c53-9ddb-7df41ee30b9b","resolution":{"observed_at":"2026-08-07T00:53:14.552744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.543295Z","title":"Beyond Reward: Offline Preference-guided Policy Optimization","venue":null,"work_id":"5709d771-08de-4ee6-a02b-d86b6107e472","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.628391Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:db136802fc65b8f0106284285c9635e54004478216dfc22d3b98d90cd36b5738","observation_id":"364218c0-d7c7-44f6-a6e0-26c1e2dd405c","resolution":{"observed_at":"2026-08-07T00:53:14.545970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.536016Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":null,"work_id":"d848d41c-51ef-4134-8ec3-82e501026a6f","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.631200Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:7fbfc136001615cf639cb5a826e96f62a1ab85ffc87c3bb26b43d620f49f0410","observation_id":"cba5540a-8275-4414-afb8-118e0aa90b58","resolution":{"observed_at":"2026-08-07T00:53:14.538656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.528759Z","title":"Learning to Discern: Imitating Heterogeneous Human Demonstrations with Preference and Representation Learning","venue":null,"work_id":"36efbff0-074b-4b18-97ea-52311c50ac48","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.633432Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:2b9923dae8de5fa99a3b3e567e565a8f7b2a2dc9b38eeb1b3d4247ff27de2089","observation_id":"1cc52139-f6aa-46bc-8f50-89faafdb063a","resolution":{"observed_at":"2026-08-07T00:53:14.531895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.521913Z","title":"Rethinking reward modeling in preference-based large language model alignment","venue":null,"work_id":"e6f7eb57-3347-45ed-b110-0084a2a6d685","year":2025},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.635700Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:acb16c3d254a00a39a3569b8edd41123678302b00a5f485f2d5f07eb663eb0f1","observation_id":"fb61f357-0b37-4a7c-bee7-13dff66eaae2","resolution":{"observed_at":"2026-08-07T00:53:14.524528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.515136Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":"3e5e4b22-788c-48a3-9958-a44eb18b5740","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.638150Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3973399e8c8f8bbe0c4afbc15c316f14f761a9d935218f3b6690045a69345895","observation_id":"4533caba-3b52-4501-8e24-c7b60990f44a","resolution":{"observed_at":"2026-08-07T00:53:14.517863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.508692Z","title":"Nash learning from human feedback","venue":null,"work_id":"919a5679-00d9-4497-9221-f5a7b4e1aeaa","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.640321Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:83ddd9ef74c088aefc17bd48170d7d7d0d6ab290ac485dafbaf8a738d8cc300d","observation_id":"8bad5c92-683e-4ad4-a002-cc55117e83cb","resolution":{"observed_at":"2026-08-07T00:53:14.511138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.501656Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"ec0d5eec-c41d-4cf9-a50e-97edb4fdcb1e","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.643844Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:9b4f547a8e84527d9f7cc8b9bdde833d02268dae50331686b6eae40acc7c50b6","observation_id":"13bdd45a-96b2-43aa-865f-65b560504c57","resolution":{"observed_at":"2026-08-07T00:53:14.504228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.495103Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","venue":null,"work_id":"ce3ca3d5-2221-4aee-805f-5970cb06fc89","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.646342Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:2ccdf9f7357e56a81029ae7c498a4883ff1c81a23fdc0f1ebe9d55d91870855a","observation_id":"70cd97ea-e593-49fa-9ef1-b44d30a25af8","resolution":{"observed_at":"2026-08-07T00:53:14.497602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.648723Z","title":"Intransitivity of preferences","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.648723Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e9ef75400dab47d56ee8b336aa7ccd6c45f6436353036de2e6fe44af8c6536d2","observation_id":"681f80ec-a3bf-4e3e-96a8-0c1c4f32eda0","resolution":{"observed_at":"2026-08-07T00:53:13.648723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.488787Z","title":null,"venue":null,"work_id":"e865330c-b626-4ea4-b1ce-90a2066030f6","year":1954},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.651354Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:dfe1a3f335b81cadd53bd0177a011aa75f480967dd369b67462f7a8229ef6061","observation_id":"a5f4cb82-180f-41ad-bc80-26a2ee1c3fe5","resolution":{"observed_at":"2026-08-07T00:53:14.491103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.481662Z","title":"RIME: robust preference-based reinforcement learning with noisy preferences","venue":null,"work_id":"3253ce64-e6bb-4b74-891e-42f2c510d0dc","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.653713Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e22fb2d7ad65fe349164025df54e97caf747c5a701dbf8d9c220b92ac5c142c8","observation_id":"fa32ebb1-b6de-484f-865b-45bde68c1df8","resolution":{"observed_at":"2026-08-07T00:53:14.484703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.474686Z","title":"AlpacaFarm: A Sim- ulation Framework for Methods that Learn from Human Feedback","venue":null,"work_id":"385ef814-6576-41ae-8b7a-7230ee2079e4","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.656095Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:08b4c3efaf2d5ba6e000072105129bc335c7760ae7951656e7a82e4df1ddd857","observation_id":"e1b4705a-362a-4749-a5dc-5b177b88445a","resolution":{"observed_at":"2026-08-07T00:53:14.477470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.467268Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"92c36552-c19f-473e-87d1-d0615f517460","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.658610Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:60f1a68d70ab7f565c9d4433581c6e1e725f2a25c8e34a2a7122df5341601a7d","observation_id":"08f7bed2-0bca-414a-bf50-9ebb75e284de","resolution":{"observed_at":"2026-08-07T00:53:14.470636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.460289Z","title":"B-pref: Benchmarking preference- based reinforcement learning","venue":null,"work_id":"08bc6aa7-d447-4e76-9da8-ada3dc53d886","year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.662379Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:b227e8ec2d78bd2b43584f870a43c912db642b6f02250d5972b5d5e5848e258b","observation_id":"49ca57c0-ffb5-4bfc-bdde-debf0a6536f2","resolution":{"observed_at":"2026-08-07T00:53:14.462842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.453690Z","title":"Rethinking decision transformer via hierarchical reinforcement learning","venue":null,"work_id":"05081d12-310b-4970-8c01-5ac0a3d28f6c","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.665757Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:87a58fb1f92c9ec6b4c8122a18056be6c8822df2f5409e156eaa28f225315d9b","observation_id":"f35ae298-7b63-4b7c-b111-39ab708b06b1","resolution":{"observed_at":"2026-08-07T00:53:14.456224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.446928Z","title":"WHEN SHOULD WE PREFER DECISION TRANSFORMERS FOR OFFLINE REINFORCE- MENT LEARNING? 2024","venue":null,"work_id":"548c3909-7018-43ee-abce-1cde5f912af5","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.668108Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d4e8cf6a432f3ef3ddba674b0d33098ed1d178cedb96700606ad61aa05abfbc6","observation_id":"93960999-efcb-4eb0-8a44-5b54d0d724f8","resolution":{"observed_at":"2026-08-07T00:53:14.449568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.440204Z","title":"OFFLINE REINFORCEMENT LEARNING WITH IMPLICIT Q-LEARNING","venue":null,"work_id":"ef68545d-07a9-4c82-a1e0-4d7e6121a456","year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.670493Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:74469589f283da05fe1b02028f4fdb5cc7413387a5ac7e4a0dde2ed92fb2f99c","observation_id":"f7b64e6a-3356-4f98-b0e9-4dda53306843","resolution":{"observed_at":"2026-08-07T00:53:14.442807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.432763Z","title":"Preference Alignment with Flow Matching","venue":null,"work_id":"687ef326-3044-4095-a0a6-596c0a9f4018","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.672687Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:e58e05993a21b3496bdf2b511e95ea3c8fcc6e52da671f7f637b23ee0779b671","observation_id":"fd154f9e-c94f-4d55-adf5-b1d0e5a085e7","resolution":{"observed_at":"2026-08-07T00:53:14.435365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.425623Z","title":"Flow to better: Offline preference-based reinforcement learning via preferred trajectory generation","venue":null,"work_id":"cb7373c5-9475-401d-bdcc-d703fa34ff45","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.675423Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:17ff32587cc0f5560dd3738b1bb0f90f7dbefdaf2198df7315e7255415535697","observation_id":"275949b1-55c3-4527-a651-7e1c23fb4b66","resolution":{"observed_at":"2026-08-07T00:53:14.428600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.677623Z","title":"Denoising Implicit Feedback for Recommendation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.677623Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:80ea1287982131a12381930e6dfc449ab18c247d467aefa8097874538bba2a08","observation_id":"cd767918-e406-4296-b1ad-44c438625715","resolution":{"observed_at":"2026-08-07T00:53:13.677623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.417112Z","title":"mixup: BEYOND EMPIRICAL RISK MINIMIZATION","venue":null,"work_id":"d7a9befe-6e62-4ce9-aef3-a90f1444cc02","year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.679660Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:4c6a9514ace99dcef06fb7c5503e94a6d6cffc836fb502747d13fd9c795ba46f","observation_id":"356483ba-d9a8-4434-8c00-6fd4d6b272cb","resolution":{"observed_at":"2026-08-07T00:53:14.420313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.410270Z","title":"Co-teaching: Robust training of deep neural networks with extremely noisy labels","venue":null,"work_id":"7feae81a-edb2-410f-a2c5-0325f1ad8b51","year":2018},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.681877Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:dbb2da52eebee59e363a48015fc8d33016b97f5d983d149e153a5866a2ce9cad","observation_id":"be9b2e01-c247-47f0-8baa-332bbc521971","resolution":{"observed_at":"2026-08-07T00:53:14.413068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.403166Z","title":"Does label smoothing mitigate label noise? In Proceedings of the 37th International Conference on Machine Learning, volume 119 of ICML’20, pages 6448–6458","venue":null,"work_id":"e7dc436b-6be3-40d4-bf53-0031d9b6a8b3","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.684352Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:33b4d6a1aa84fe0c90170148fe43f0e7de1127e174f2c39bda1750ce6c606355","observation_id":"29d4218a-fc9c-49e8-aa23-01dd9802a5bf","resolution":{"observed_at":"2026-08-07T00:53:14.405932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.686484Z","title":"Learning from noisy labels with deep neural networks: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.686484Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:abc4a494cf76c515f82ccf1fa0eefc6df6a2ca1a03521e5a54770d6425487371","observation_id":"5bb06fb2-59c1-4f04-81d9-f9e6de1d2d0b","resolution":{"observed_at":"2026-08-07T00:53:13.686484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.396376Z","title":"Attention is All you Need","venue":null,"work_id":"d273e22b-612c-4a44-bf4b-b59b4f39df5f","year":2017},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.688693Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:98b22d21582f1be57dbf6f1fd6f2cbb449886e8755fcdb30c5da6fa7cc9eb972","observation_id":"340f57f2-d046-4e68-93fb-8f4a829786b0","resolution":{"observed_at":"2026-08-07T00:53:14.399011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.389639Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","venue":null,"work_id":"153b429c-3bf9-4766-b0bf-636d0b7c3249","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.691043Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:6cc3b5ce103cfac86e313e95fad36a4bc762622fb7c2c29ff53fc6f44ef933c5","observation_id":"07b25ea8-2a8e-4604-810c-a4532a8e2b03","resolution":{"observed_at":"2026-08-07T00:53:14.392260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T00:53:13.693302Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning, February 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.693302Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:95aa60f90c8e73a8ca401333beb88837c8620eed0c999580b9e8a22bbe962584","observation_id":"d4dcb6c3-5bc3-4569-a471-ca88d75bbcca","resolution":{"observed_at":"2026-08-07T00:53:13.693302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.382657Z","title":"D4RL: Building Better Benchmarks for Offline Reinforcement Learning","venue":null,"work_id":"b503cef8-5665-425d-907b-005d35539749","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.695735Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:aae09a5d5d42f49c588334712271b4f0958d7231c40b2854f61e2c033e029bfd","observation_id":"ebefa7eb-9474-40c3-84b9-61dc1a853f1b","resolution":{"observed_at":"2026-08-07T00:53:14.385421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.375473Z","title":"URL https://www.gymlibrary.dev/environments/ mujoco/index.html","venue":null,"work_id":"e8ab890c-6cb4-44c4-b9f1-5a1e63b5dc5f","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.698093Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:8bc9804aeb67459b928451d9feeedcdc494a42741493e13940a9312b5b5c5836","observation_id":"0c06b20e-a5dc-42b0-86c5-cf226630a8c7","resolution":{"observed_at":"2026-08-07T00:53:14.378249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.367927Z","title":"Offlinerl-kit: An elegant pytorch offline reinforcement learning library","venue":null,"work_id":"8766d03f-4f21-4c58-b9f8-89b4a87fc2ff","year":2023},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.700406Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:8627393e132e593a64cd87a6a781468344c96e3d2e427b186a4bde44a54f8d70","observation_id":"5883a3ed-b7f8-4bac-8410-542612030a70","resolution":{"observed_at":"2026-08-07T00:53:14.370970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.360136Z","title":"Hierarchically decoupled imitation for morpho- logical transfer","venue":null,"work_id":"4f40fc06-7757-4283-9216-a11b5827f0d2","year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.703454Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:01b96dc7fddfefc87136a2a0f2a58d80262d862fa38df34bd534fcb4e213c4ab","observation_id":"acc20467-b73a-4e61-aafb-0e89c97011d2","resolution":{"observed_at":"2026-08-07T00:53:14.363018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.351697Z","title":"PEARL: Zero-shot cross-task preference alignment and robust reward learning for robotic manipulation","venue":null,"work_id":"e4778c17-cf26-475b-9c7b-2db975f4389d","year":2024},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.705831Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:285e57a764fdbb77f4f5c6e7dd88c8a83f15dfd141b1cad564a39586542f40aa","observation_id":"b8b6faf0-90c2-4efb-a873-f36946864a93","resolution":{"observed_at":"2026-08-07T00:53:14.354877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.708152Z","title":"Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.708152Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:508cca99e430a055f5f83897a6e5d1c2b472c4e679119975f7c92b1b0f1e893b","observation_id":"faa778ae-004a-4dde-8ba4-0f0d7a677f57","resolution":{"observed_at":"2026-08-07T00:53:13.708152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.710490Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.710490Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:32bfc6cf51cd7d42c29be0e8b4e58bd80ba7a745976f603bf5df4394fb237a6f","observation_id":"69bc5927-4172-4956-8c45-9083497c7694","resolution":{"observed_at":"2026-08-07T00:53:13.710490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:13.713036Z","title":"dm_control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.713036Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:feaaf7c949384f1c38a2d32ec884da6556ea4f0dd126416853e0809baa5fec92","observation_id":"ab1552f6-f733-4b52-9d09-1b90227dd761","resolution":{"observed_at":"2026-08-07T00:53:13.713036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.343704Z","title":"URLB: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"cc508840-8f9c-4404-9af2-67d7fbf3edbe","year":2021},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.715496Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:d59febbecdb73893ac1b9145625099687fc9e326083985714b9b23d220baf2a7","observation_id":"8e0ccee2-5793-45ba-b7b4-5e6d7602df08","resolution":{"observed_at":"2026-08-07T00:53:14.346513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T00:53:13.717937Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.717937Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:4ce934fa80a676312ef8336cfb65aae5f7b508afa846e2157ef47b60bb9a60d7","observation_id":"103bccc0-2245-448a-b121-76970064a4ac","resolution":{"observed_at":"2026-08-07T00:53:13.717937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.336079Z","title":"URL https://docs.pytorch.org/ docs/stable/generated/torch.nn.TransformerEncoder.html","venue":null,"work_id":"417e1aa9-58ad-495b-9d3c-ddc909699ed1","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.721084Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:4641845188585e55158c0020117727665defd4c359d74ec45fafda03bd839bf0","observation_id":"ce58efbb-6332-4e03-81a4-6bd802df36c9","resolution":{"observed_at":"2026-08-07T00:53:14.338969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.328033Z","title":"URL https://www.gymlibrary.dev/environments/ mujoco/hopper/","venue":null,"work_id":"dd7128dc-14ed-4408-b31d-980db222b870","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.724721Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:9bf64ffde0fa096113aa04c8b838dbc01a343254b2133765f9ef465c3c70ac7f","observation_id":"9c3c1e64-16a1-4f96-92c9-bfcd397821ca","resolution":{"observed_at":"2026-08-07T00:53:14.331172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.319949Z","title":"URL https://www.gymlibrary.dev/environments/ mujoco/walker2d/","venue":null,"work_id":"5d2c6b35-53d8-43c9-92a7-05177df7b319","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.727226Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:a10219408509f020497054f40d03a8990080fae51d29479fe34908423b30c737","observation_id":"26b71533-3a9e-45e8-96ae-1e3ad80676d8","resolution":{"observed_at":"2026-08-07T00:53:14.323213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.310831Z","title":"For the Franka Kitchen tasks, we use the preference datasets from An et al","venue":null,"work_id":"fda3b310-bfbe-4588-9c0b-c124a8564276","year":2000},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.730009Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:cb6b0e6d1ba44051925396fba8247d02e09ddd202ac3267086a748ac2fddc55c","observation_id":"ab7ec7ee-36e9-419b-9380-ac83076703d1","resolution":{"observed_at":"2026-08-07T00:53:14.314920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.584659Z","title":"ISSN: 2640-3498","venue":null,"work_id":"485c2b1d-e571-4063-aa7e-99333fa993ce","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.613923Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:3775909f37c31475cf364d51830fde0acafe519d7ba6ffc639b283a5a485c152","observation_id":"41a941b2-d2f4-404f-8b60-2b89f0b89425","resolution":{"observed_at":"2026-08-07T00:53:14.588090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:14.563560Z","title":null,"venue":null,"work_id":"a3a9d1da-c5c8-469f-9eb5-2d156440f673","year":null},"citing_paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:13.621171Z"},"links":{"citing_paper":"/paper/2506.12529"},"observation_digest":"sha256:49e204c59edcc14e97b0d9458365d287e37c39be3eeca22c6ca76d42e7eb0460","observation_id":"0347b73b-0a39-4a05-b278-31a057847404","resolution":{"observed_at":"2026-08-07T00:53:14.566095Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12529","last_updated":"2026-07-16T08:43:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:44:30.392257Z","submitted_at":"2025-06-14T15:01:59Z","title":"Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2506.12529."}