{"as_of":"2026-08-07T23:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b48ca2096caf85d982e93a64cd9bdd3a4667b5ac234940df26df2b594602140","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:20:15.714867Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T04:48:15.394329Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T11:35:19.307998Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"cited_work":{"arxiv_id":"2506.03066","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03066","snapshot_observed_at":"2026-07-21T00:19:49.870688Z","title":"Zhang and L","venue":null,"work_id":"9cc8f565-4b7b-4f02-b254-81a8e9693412","year":2025},"citing_paper":{"arxiv_id":"2604.17747","last_updated":"2026-04-20T03:04:12Z","snapshot_observed_at":"2026-08-02T19:51:15.952118Z","submitted_at":"2026-04-20T03:04:12Z","title":"Efficient Federated RLHF via Zeroth-Order Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T04:48:15.394329Z"},"links":{"cited_paper":"/paper/2506.03066","citing_paper":"/paper/2604.17747"},"observation_digest":"sha256:ba6e58e678f3388af4861cb9045d1c6eb8929bf4b644871c559f312a95ea7c20","observation_id":"c6d37a12-b035-4679-b920-5dea3a8d1499","resolution":{"observed_at":"2026-07-21T00:19:49.870688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03066/citation-record","integrity":"/paper/2506.03066/integrity","json":"/paper/2506.03066/citation-record.json","paper":"/paper/2506.03066"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.114854Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.114854Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:1cb07115b97499a98a2be2e28b0e97308acc93e432f35352aae15aed2e514a5b","observation_id":"e9703832-2747-4b73-8c47-4467da086c5e","resolution":{"observed_at":"2026-08-07T11:20:10.114854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.203695Z","title":"Controlled experiments on the web: survey and practical guide","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.203695Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:07c56fd26958c106ecd6a954b94c499a18e46185be18ca14c1c2d8d693bf4f4a","observation_id":"70fe8ede-870e-4e44-ae03-67b1798c8153","resolution":{"observed_at":"2026-08-07T11:20:10.203695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.296587Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.296587Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:8f33e93f5397250fe16c4975dd4af8d72e03a49f05151391516fd41b86f447eb","observation_id":"2de9bc8e-27eb-4749-95be-5ba5d2ac8ec5","resolution":{"observed_at":"2026-08-07T11:20:10.296587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.405514Z","title":"Al Sallab, Senthil Yogamani, and Patrick Pérez","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.405514Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:61808870b64a85d6ec1ed0286166825aa23155b11647d210c8c91c9dab2d6f32","observation_id":"2916cde9-d8b5-465c-97bc-8968f3927110","resolution":{"observed_at":"2026-08-07T11:20:10.405514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.525911Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.525911Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:7ff78368d10b724fa60769957f5acb7333f313630d696cd1bb25d458cf04b6c4","observation_id":"739bf0c4-c7c9-4cd1-bc45-3be231cf17ea","resolution":{"observed_at":"2026-08-07T11:20:10.525911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:20:10.608779Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.608779Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:0d9c54f1aa8a05afe3efe155c49b55ec48baf1fca8d9d86230a3c4ceeb3e0d0e","observation_id":"ca01d7dd-fa85-480d-9975-8a0b310cb5f4","resolution":{"observed_at":"2026-08-07T11:20:10.608779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.716180Z","title":"Dynamic programming and stochastic control processes","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.716180Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:3da3f3fe8a6c9976e98f9de76ed27a645f79f882864ec8e5d55b0a744bffaccd","observation_id":"99c7fe35-9628-4b78-b4ab-abb6f85799f3","resolution":{"observed_at":"2026-08-07T11:20:10.716180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.827799Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.827799Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:73193db92a922b8694bd9f6c2fa2a648778b9a482951d8fe4d0317dd0db39e87","observation_id":"192aba53-7d83-4907-ad1b-7861438a4a85","resolution":{"observed_at":"2026-08-07T11:20:10.827799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:10.891470Z","title":"Inverse reward design","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.891470Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:b551cf8cc08fc89ee43da3057bc58d4a7f6a0449e2b1463c71d944a332ef57dd","observation_id":"5d6406f9-6fc8-452a-874a-8d9f581f79e9","resolution":{"observed_at":"2026-08-07T11:20:10.891470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T11:20:10.973403Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.973403Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:b210f08aef1d4820b94d15986234956d004ab9352d12d15335590ac516d02c92","observation_id":"de54f59e-6712-4905-8a83-7fe6714d6b9d","resolution":{"observed_at":"2026-08-07T11:20:10.973403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:11.056676Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.056676Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:0081d700c87f71f964e7c78c021bbac2ff8b4c21927ccd39a18c9b8583dcbe23","observation_id":"6f2ccb55-f03d-4c47-9196-aa7b47ef13c6","resolution":{"observed_at":"2026-08-07T11:20:11.056676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T11:20:11.242520Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.242520Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:dbfbf40a61f4e00a8816103cfca96516a421759112de35bcbf726be9c6feb877","observation_id":"c50e7a09-cd8c-4f95-834e-d184db24cd46","resolution":{"observed_at":"2026-08-07T11:20:11.242520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:20:11.353435Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.353435Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:dd3badb7cc757ed0e541ddaba719c7637ee84057b5c173e570bb9c3ab2efb8a7","observation_id":"31d800c5-7bad-4ed5-8efc-6e2d80ecf082","resolution":{"observed_at":"2026-08-07T11:20:11.353435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:11.439190Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.439190Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:4cf4ef99209725c165968d697e968f87516bf08b5ae7c825102327f858977ef0","observation_id":"1534fe5b-74b5-4f5f-a2bb-9c1b5495e071","resolution":{"observed_at":"2026-08-07T11:20:11.439190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:24.413446Z","title":"Zeroth-order policy gradient for reinforcement learning from human feedback without reward inference","venue":null,"work_id":"82d61805-fa43-4412-833a-55acad4aa4b5","year":2025},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.554482Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:8ea0f449ee3e16283b34a3fc354c74dde56c48c43194a1fda204c61416a2bc37","observation_id":"e5c0ff52-d75e-47a2-bb45-e07577dc1094","resolution":{"observed_at":"2026-08-07T11:20:24.434223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:11.665749Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.665749Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:7e1474e0556c54e61f2a5c2357b95dfda49ee1c891f60f6ef324b1f64550afc5","observation_id":"5def0db4-fbcf-475d-b4d3-3d100ea593d7","resolution":{"observed_at":"2026-08-07T11:20:11.665749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:24.243406Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":"886189ab-38a2-4e95-8117-c689c4a86b8d","year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.755552Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:5e1b530bf84574d0f57609210efdefba376cd7871959d9b14964f859af9c0356","observation_id":"a80d8297-66c6-4289-8a23-988584021b24","resolution":{"observed_at":"2026-08-07T11:20:24.322900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:24.075778Z","title":"Lee, Wotao Yin, Mingyi Hong, Zhangyang Wang, Sijia Liu, and Tianlong Chen","venue":null,"work_id":"3511503f-1707-4b2b-becf-5244702e08c5","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.793743Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:212d61507a5a4c2fce5f96b363147aac6cf762c79f0d701bceacec8a29275c79","observation_id":"2b6d06d7-162f-4354-abc4-664102270b38","resolution":{"observed_at":"2026-08-07T11:20:24.164237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:23.887883Z","title":"From r to q^ * : Your language model is secretly a q-function","venue":null,"work_id":"5a0c5267-1ce9-4f22-bc7c-b14c86dc3966","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.799620Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:357971e0cac873fd12f7915de7044b2f37ece1f9d6d1f9ddf47d7a4543956a37","observation_id":"4656b496-a7a3-473d-9590-2e947e847154","resolution":{"observed_at":"2026-08-07T11:20:23.963362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:23.709259Z","title":null,"venue":null,"work_id":"20dd809c-2050-4916-9a37-c23dade3836f","year":1952},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.839237Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:f9d2280d14f4a1a776a243b0cd7690e5bcfb53b19893b45c0031cee207ef1985","observation_id":"b76e2247-cc93-4d0b-841a-15c87dfc1c31","resolution":{"observed_at":"2026-08-07T11:20:23.787862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:11.906112Z","title":"Random utility theory for social choice","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.906112Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:26a1aea46af80388cfab1be3991c7bc212cae1aa090ab2877f4b095e22e7dfc1","observation_id":"2105833b-782a-4fa4-b5d9-68dbaa0f8459","resolution":{"observed_at":"2026-08-07T11:20:11.906112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:23.595184Z","title":"Modeling ordered choices: A primer, 2010","venue":null,"work_id":"e87637b6-d388-47c7-a6ba-bcdb176da572","year":2010},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.971612Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:d1b0c80608560a4ac9e2d8f9e4b567f32789804dccf13680d48349572d3253b4","observation_id":"7519c8fe-e391-4f82-b614-f4e0aa2e2cd9","resolution":{"observed_at":"2026-08-07T11:20:23.658611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:23.379572Z","title":"Econometric analysis 4th edition","venue":null,"work_id":"8682422d-b89c-4b43-a2a4-088b25a71714","year":2000},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.030921Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:c777ca87708c86a22c8c64b54dcec8fe945be4a50fb7a36cd56b4c965aa3a77c","observation_id":"a1d649d2-8446-4572-87bf-486af6d3ef41","resolution":{"observed_at":"2026-08-07T11:20:23.504855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:23.196735Z","title":"Sensory evaluation of food: principles and practices","venue":null,"work_id":"f7885bba-190e-4b0a-8db9-e7bc450df118","year":2010},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.101142Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:c31a2dda5f12b0dce02e88075bb04b0e40d4629ac618f8ac91ae7316c4ef9d46","observation_id":"571facf2-89e0-497e-8702-1fd5b464a369","resolution":{"observed_at":"2026-08-07T11:20:23.282474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.981512Z","title":"Sensory evaluation techniques","venue":null,"work_id":"6358d6a8-1dda-4f7e-89b8-421e83b5e5b2","year":1999},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.166328Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:bc97625b46cc150e033ff80e822686f6d6245bcf2368b294e121736828178a10","observation_id":"097214b3-cd0f-4089-a3e8-c302ce0d7ae6","resolution":{"observed_at":"2026-08-07T11:20:23.069453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.789678Z","title":"Nash learning from human feedback","venue":null,"work_id":"ee0cb15c-2424-426f-a69f-27a80fb3b9c7","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.215572Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:470651ae7d8104a48ad7b0dd9f526ff034d3670ae80a3a3c239081a5289b8a79","observation_id":"0b3b9f97-ef92-479c-bb26-deb82ab8b5de","resolution":{"observed_at":"2026-08-07T11:20:22.880574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.649744Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"8460515e-e790-4722-966e-cceb58e333cd","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.318773Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:764c6d879f872a8d4b58f33ace1f7cec47bdd54dad38365d2d9b1a64480d557a","observation_id":"9cca57ca-66e0-4d12-bbd7-2c97d1726096","resolution":{"observed_at":"2026-08-07T11:20:22.715947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.493042Z","title":"Models of human preference for learning reward functions","venue":null,"work_id":"28584edc-81eb-423a-aefc-6390c5097811","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.395294Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:789a49655c825657a3f673bb320c0ca730cdf7658d94993ff26cf4e85bc43f8f","observation_id":"f44cfb7f-350f-4cc4-ae86-c53b6055920e","resolution":{"observed_at":"2026-08-07T11:20:22.557457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.320432Z","title":"Reinforcement learning from human feedback without reward inference: Model-free algorithm and instance-dependent analysis","venue":null,"work_id":"8ed7b190-edb2-492d-bce4-c6f53c2e8f21","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.569486Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:b4dc16dbfe1e40c03846f28b64b567c733aff54b7d5c0e05813ccc9c991965a9","observation_id":"1120e8b4-c18f-4faa-8d3b-7be8f969d57a","resolution":{"observed_at":"2026-08-07T11:20:22.399902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.170717Z","title":"Preference-based online learning with dueling bandits: A survey","venue":null,"work_id":"e75dac04-5e46-4b13-8a60-87e6c0eac031","year":2021},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.737974Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:a3c68429d303eeb2af3736a76b37e166e61dfbb1ebd17444f8d42b0a2ae49bb9","observation_id":"16fc529c-6624-49cd-89d7-04165b8a6dc4","resolution":{"observed_at":"2026-08-07T11:20:22.244253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14111","last_updated":"2023-11-03T18:36:03Z","snapshot_observed_at":"2026-07-06T15:46:21.260261Z","submitted_at":"2023-06-25T03:18:15Z","title":"Is RLHF More Difficult than Standard RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14111","snapshot_observed_at":"2026-08-07T11:20:12.854603Z","title":"Is rlhf more difficult than standard rl? arXiv preprint arXiv:2306.14111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.854603Z"},"links":{"cited_paper":"/paper/2306.14111","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:2422373b9fd1dd4f22fad7471126c40269c9957975f19cf0b767a56ab8377cc2","observation_id":"68c03123-55da-4bc6-a574-bbf61d4e86f5","resolution":{"observed_at":"2026-08-07T11:20:12.854603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:12.936227Z","title":"A survey of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.936227Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:9d228061ce21ec64521aa5966798c9edc22b71299e26808078c7a008a2eadfef","observation_id":"155b393a-2365-4814-8dc9-7b9c21daf1bc","resolution":{"observed_at":"2026-08-07T11:20:12.936227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:22.038327Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"939adefe-b54c-427e-bfed-3f5a8016f6f9","year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:12.957795Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:66ddeaa860ca7ab4a6326d9cffef68b40e8e429f974ef37c6f035447fa2c77c4","observation_id":"ce96e202-23b6-4bcb-aa22-30374648414c","resolution":{"observed_at":"2026-08-07T11:20:22.106083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v30i1.10269","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.812747Z","title":"Model-free preference-based reinforcement learning","venue":null,"work_id":"a322b3c1-a3de-4120-ba27-38156957a9b4","year":2016},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.050288Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:fb8e40bcbae1f97d7d7c3182eaa94c5edd7df7c87fee48b08edc69ff97405f6f","observation_id":"eb2419d6-f622-4eaa-b050-50fb1789f50c","resolution":{"observed_at":"2026-08-07T11:20:15.864764Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T11:20:13.111892Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.111892Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:17a5d31c32b33eee49288a35d8826c96b01cbedbdb9fb86a077ed345d5d827a3","observation_id":"852239dc-55ea-4a60-bd60-6d5db5a9e88b","resolution":{"observed_at":"2026-08-07T11:20:13.111892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T11:20:13.164246Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.164246Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:c468cd78697b1ac4f2ee04055a3991a7045fa1c36a0761499177a300c81b8612","observation_id":"47499b1b-0fdc-41be-b7ed-be6849a3b848","resolution":{"observed_at":"2026-08-07T11:20:13.164246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:21.875532Z","title":"Iterative data smoothing: Mitigating reward overfitting and overoptimization in RLHF","venue":null,"work_id":"c23c2728-c3bf-4840-ac6d-02c3b4297873","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.204264Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:33a699fc6e27f2ff8b6114a9b244b1e4316c8127309bdc8e3d3aeb67697bd78b","observation_id":"eb008823-5efe-47a6-9bb5-5b36aaab89fe","resolution":{"observed_at":"2026-08-07T11:20:21.959204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T11:20:13.243909Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.243909Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:fe6b174a84b93fe32561ba1d63e0f073429610ecca3a1608cc37bc38da4dee5a","observation_id":"c53d914b-6a9f-429c-97e9-e5b27852a45f","resolution":{"observed_at":"2026-08-07T11:20:13.243909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:21.737609Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for RLHF under KL -constraint","venue":null,"work_id":"f8faed1e-104d-4c12-a85c-c5393a0c0e88","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.281397Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:8bc0c654fb10f5599a026172b107ed3b04d2cfacbf9a06c5c793d09c27d0b824","observation_id":"72383b3d-0aa4-47c7-952e-3f082282bcbf","resolution":{"observed_at":"2026-08-07T11:20:21.818904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T11:20:13.316647Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.316647Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:4dfc6f2f215d3dc46f82a528a41dc31b8dc8de88ff1b0b0a505431f775c2c508","observation_id":"faf8bccb-9cd4-44ef-92c4-992109603475","resolution":{"observed_at":"2026-08-07T11:20:13.316647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:21.536106Z","title":null,"venue":null,"work_id":"822ad1dc-5f0a-40b7-93af-0b0e6a24bc16","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.349331Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:5d19edb989e068e0b3cc4762f0ffaa539eda86039b6404dbb74f4c88113e7cb6","observation_id":"4e900513-ea97-4973-99b3-e7ed056381b2","resolution":{"observed_at":"2026-08-07T11:20:21.642253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:21.327864Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":"4d84c479-8004-43e6-a7ed-e18a423df4fe","year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.386029Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:3a81ba93e4182c72b083f54c5d671f5f6f78bff2cda9341f6df7fd7cb7ed4d32","observation_id":"fde34b94-7148-45ca-9177-fabbbd68ac2d","resolution":{"observed_at":"2026-08-07T11:20:21.447430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:21.160014Z","title":"Lee, and Wen Sun","venue":null,"work_id":"ad1fd8a6-5d98-48f7-a0d2-da224dd10939","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.420179Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:2ed150023e3de8277fde9744eea3b6c3374fdf2256572b76d0059dfbad03a2a7","observation_id":"d3376d72-f218-4f16-979d-2b5ac0b7f007","resolution":{"observed_at":"2026-08-07T11:20:21.240433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:21.014588Z","title":null,"venue":null,"work_id":"714e2e0c-8d7c-4069-af6a-3f9f99436fdc","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.440411Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:c5b80e89d04b2a2194f1f2322a219a687f83407597bc988ef7a3fd95b0d61f79","observation_id":"c27ff57d-d834-4f70-9e04-45b415b4032f","resolution":{"observed_at":"2026-08-07T11:20:21.078126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.909747Z","title":"Principled reinforcement learning with human feedback from pairwise or k-wise comparisons","venue":null,"work_id":"22a430a6-2f99-4c4f-93b9-68dda9ccd434","year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.473666Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:2ead79e980bd7083f86ad4f28ea3a1cb75c917d431332c7502205fd73786d7aa","observation_id":"cb357bfe-a7f0-42b9-8cf9-09477257b24f","resolution":{"observed_at":"2026-08-07T11:20:20.936211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.740801Z","title":"Provably feedback-efficient reinforcement learning via active reward learning","venue":null,"work_id":"e1e470ee-4e60-40eb-a37f-1731a35e4fcc","year":2022},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.509008Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:e9c42b1a598f699370527711166474dce7225c008022830af19703ccfc7735fe","observation_id":"c998c1d4-4d99-46c4-bd9a-40bf5731e69c","resolution":{"observed_at":"2026-08-07T11:20:20.811129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.514997Z","title":"Making RL with preference-based feedback efficient via randomization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.514997Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:839f9ddfb962a44524e2aa4d58e805143d4dff5d796cc69a69ba2f6e461d76bf","observation_id":"0233317e-db04-4053-aae1-f918664243a0","resolution":{"observed_at":"2026-08-07T11:20:13.514997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18438","last_updated":"2023-07-03T13:08:46Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T01:18:39Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18438","snapshot_observed_at":"2026-08-07T11:20:13.572546Z","title":"Reinforcement learning with human feedback: Learning dynamic choices via pessimism","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.572546Z"},"links":{"cited_paper":"/paper/2305.18438","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:b3b9227dfeb7ec985b9952b830416c0830fae8b154ebce52c81bcdf05c929bf2","observation_id":"c477f12d-8642-45e5-9f7c-6d8ee20d0c30","resolution":{"observed_at":"2026-08-07T11:20:13.572546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.593185Z","title":"PARL : A unified framework for policy alignment in reinforcement learning from human feedback","venue":null,"work_id":"f3b58b83-c890-4fcb-85b8-b3472acb7c6b","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.622186Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:a36988751f1396e61db0d4164fef2448687a9c4182856654edc4e6315e638c43","observation_id":"dd8c175d-60e3-4c22-a873-2d522bf430d3","resolution":{"observed_at":"2026-08-07T11:20:20.698009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03282","last_updated":"2024-11-09T07:09:00Z","snapshot_observed_at":"2026-07-06T17:25:39.546901Z","submitted_at":"2024-02-05T18:38:55Z","title":"A Theoretical Framework for Partially Observed Reward-States in RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03282","snapshot_observed_at":"2026-08-07T11:20:13.676261Z","title":"A framework for partially observed reward-states in rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.676261Z"},"links":{"cited_paper":"/paper/2402.03282","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:c11e5562c9e5cb1b5283878540b2baee2a1e60023f23d6634cb37a7b0fb234f9","observation_id":"5e79b9c9-f0f6-461b-8c8b-9946d45997bc","resolution":{"observed_at":"2026-08-07T11:20:13.676261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-07-31T03:29:04.443362Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-07T11:20:13.714921Z","title":"Exploratory preference optimization: Harnessing implicit q*-approximation for sample-efficient rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.714921Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:00ccc32f8539afa7e8df469ccf24a7482a02602fed7961b95eb8eecf2453e641","observation_id":"ed9d7dcf-c55c-4cba-b980-2322526f4b1e","resolution":{"observed_at":"2026-08-07T11:20:13.714921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.768418Z","title":"Preference-based reinforcement learning with finite-time guarantees","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.768418Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:0253fa0c1bac0e73f788289915c8fbae4a505bfeed8e3a7716a3943ecdbb6754","observation_id":"6690ffa4-8c86-4f9f-92e0-78b78d683504","resolution":{"observed_at":"2026-08-07T11:20:13.768418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.436151Z","title":"Zeroth-order optimization meets human feedback: Provable learning via ranking oracles","venue":null,"work_id":"89b41ef5-e50c-4490-8a77-3f5ed7bb22e3","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.828580Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:e915dfa927115952420e62efca1751aa14fa9f3f8019f73b35f21181bdf3758d","observation_id":"a625c456-97f1-4a52-8f94-1a6d6771ea27","resolution":{"observed_at":"2026-08-07T11:20:20.474693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:13.869262Z","title":"Interactively optimizing information retrieval systems as a dueling bandits problem","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.869262Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:6a3e8981ef8768adf440073965366822dd566a539e293b57c29070c592f6ae99","observation_id":"7340b7ca-af8f-47b1-826f-1103e648a73a","resolution":{"observed_at":"2026-08-07T11:20:13.869262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.294797Z","title":"Beat the mean bandit","venue":null,"work_id":"16268327-883a-4ae2-b7b5-a781bc8708c9","year":2011},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.903719Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:863602c05d12fbc47180e6f6da5763a04a1e6184bb0dbc09518c0d0cfe077771","observation_id":"37158a94-e721-48dc-9a56-9d4451dae6fc","resolution":{"observed_at":"2026-08-07T11:20:20.339023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.170706Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":"8aa7fede-0e3a-419d-8077-c719cf7ff526","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.939206Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:a9ed60315f0e55a9dad7e47b62316c466e2ec48aa031c8e01a2614ae6f640698","observation_id":"36498c12-90fc-466f-a433-0d8d4b0b5411","resolution":{"observed_at":"2026-08-07T11:20:20.260964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:20.069796Z","title":"Human-in-the-loop: Provably efficient preference-based reinforcement learning with general function approximation","venue":null,"work_id":"8e58c2c7-cde9-43cc-bdda-17a11bd9fd9c","year":2022},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.972232Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:1e939056aa6dd4fb964f03c389d3306176c0fab38752a3a7e301672b26267459","observation_id":"e48c9491-b216-4f2c-8dce-4cfe88ce4f50","resolution":{"observed_at":"2026-08-07T11:20:20.110017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:19.930178Z","title":"A theoretical analysis of nash learning from human feedback under general kl-regularized preference","venue":null,"work_id":"26c40d7a-c2b3-4609-ba28-2d5c45e3c20c","year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.994701Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:783966c49179d690add379598d50373baae37c937344fcf380e17bfd1dcc3bb6","observation_id":"5f9fc27b-a6fa-45d6-aceb-bc102ab9b3c0","resolution":{"observed_at":"2026-08-07T11:20:20.005951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08942","last_updated":"2025-07-09T05:35:31Z","snapshot_observed_at":"2026-08-07T17:11:35.450079Z","submitted_at":"2025-03-11T22:44:54Z","title":"Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08942","snapshot_observed_at":"2026-08-07T11:20:14.045330Z","title":"Extragradient preference optimization (egpo): Beyond last-iterate convergence for nash learning from human feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.045330Z"},"links":{"cited_paper":"/paper/2503.08942","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:57d041341cf2f266bfdfc4c0b977ba76166f6032396887291957e986011932d6","observation_id":"5cd7e6c0-792b-4999-8f7b-1ef62dfc01ff","resolution":{"observed_at":"2026-08-07T11:20:14.045330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T11:20:14.109193Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.109193Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:729859cbe728d14deee32f8998844af7a442973d4f224ad309678d8995f20c1e","observation_id":"e7f15eb2-1f01-4a41-b31c-5f4fe31cdcbc","resolution":{"observed_at":"2026-08-07T11:20:14.109193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00617","last_updated":"2025-03-03T03:41:11Z","snapshot_observed_at":"2026-08-04T13:20:45.016742Z","submitted_at":"2024-06-30T08:00:34Z","title":"Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00617","snapshot_observed_at":"2026-08-07T11:20:14.166568Z","title":"Iterative nash policy optimization: Aligning llms with general preferences via no-regret learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.166568Z"},"links":{"cited_paper":"/paper/2407.00617","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:fb8ed7902409733eae06e5155e06d72caf1e502f9af57ebfa245a0893bcc0b4d","observation_id":"7d609393-a485-48e9-831d-0d2108ca7be1","resolution":{"observed_at":"2026-08-07T11:20:14.166568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.251100Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.251100Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:8cc03cea19c1a411ee94ea20b02a02fb4291abc9b02baf0f2bb81db5a1626075","observation_id":"d1155787-5804-4de0-aab3-ff4b133c206a","resolution":{"observed_at":"2026-08-07T11:20:14.251100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:14.327923Z","title":"Random gradient-free minimization of convex functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.327923Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:d49ea926c543cafe70b4168332b1cd626482800defac8bcd8aa69678f3ac5ef3","observation_id":"b2cbb1d1-4a3a-4b1a-98d2-495f1ea29c8a","resolution":{"observed_at":"2026-08-07T11:20:14.327923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:19.795371Z","title":"Zeroth-order online alternating direction method of multipliers: Convergence analysis and applications","venue":null,"work_id":"37cec259-a94a-4f51-9d3d-60d718e365ce","year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.392308Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:d5e04b3f9aa10dd95da24f1bcec45ee484b9da403d2ccab3feb3205694d272f3","observation_id":"4b2c1b49-9dbc-4dff-9042-fe52767810be","resolution":{"observed_at":"2026-08-07T11:20:19.876255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:19.646857Z","title":"Zeroth-order stochastic variance reduction for nonconvex optimization","venue":null,"work_id":"70898a4d-14c0-425f-9bad-b7eecb7d631c","year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.448455Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:270b2bdc9dcb3c5aec1cab29d3d1179b0e953fe678602136923cb22798bca23b","observation_id":"883be79c-b080-49d3-b44d-2ed6fc91247e","resolution":{"observed_at":"2026-08-07T11:20:19.744327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:19.425908Z","title":"A zeroth-order block coordinate descent algorithm for huge-scale black-box optimization","venue":null,"work_id":"999e7c5b-8d88-4bb4-8b01-97ea153480a0","year":2021},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.553872Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:3b990268449d9aac0f2f1c6ef5912973f94286355b4b59fc69186b263f639587","observation_id":"971ae2dd-6d2d-4f65-ab50-7b305d4b7b0f","resolution":{"observed_at":"2026-08-07T11:20:19.522274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:19.163085Z","title":"On the information-adaptive variants of the admm: an iteration complexity perspective","venue":null,"work_id":"fb93d64c-ec01-4a37-9ba2-54b0aed1c935","year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.628579Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:6d81ba6c0f32e82c1d448bd76fd271cabe448e24c0f424b2dfa8d2d525932d40","observation_id":"6aa4c8eb-31e8-4123-8fd8-86f3fa3e4b86","resolution":{"observed_at":"2026-08-07T11:20:19.280656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:18.920646Z","title":"Fine-tuning language models with just forward passes","venue":null,"work_id":"8d083dac-95b7-483c-a408-3a686c08cf9e","year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.679574Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:f31d6a4bf150e957f2066fa42c9079d8b3de916ccead8aba8c785a05c39e5ea0","observation_id":"32a34c98-7b60-4904-a31b-ac0bc3ab8a24","resolution":{"observed_at":"2026-08-07T11:20:19.029182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:18.647313Z","title":"Evolutionsstrategie","venue":null,"work_id":"12b8f96b-e254-41a2-a162-f3e33ce9e7cb","year":1973},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.753674Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:8cde669cbd9031ae0f81038188ecbe2c5b238321d82a0d9967997d1f7e7a1e29","observation_id":"07876c0c-5d52-47f5-8453-efbe4022bbcc","resolution":{"observed_at":"2026-08-07T11:20:18.777335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-07T11:20:14.770317Z","title":"Evolution strategies as a scalable alternative to reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.770317Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:eb1557c35a8102104b12c75a8c503b3fe17a8c78af68b6e3acd063ab979babda","observation_id":"f1de5ea6-2bb9-4c81-a9dd-ca48cfc2ac06","resolution":{"observed_at":"2026-08-07T11:20:14.770317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:18.387340Z","title":"Improving exploration in evolution strategies for deep reinforcement learning via a population of novelty-seeking agents","venue":null,"work_id":"f074522c-0b49-46a4-a3d9-fd6758a52045","year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.834484Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:3b5b87af84be0e1aa9ede19b2547f92a439b6084370ed01bdc30cd6f4a528d7b","observation_id":"284ff06e-fe75-4924-ad8d-f9a1aeeae412","resolution":{"observed_at":"2026-08-07T11:20:18.519056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:18.099145Z","title":"o r \\'e nyi, Paul Weng, Weiwei Cheng, and Eyke H \\","venue":null,"work_id":"0ce1b7b2-67d9-47ad-83e1-60dfaf2ddf4a","year":2014},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.893600Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:22bf18d52412390d9696a0799a19f9016ecbb942e2b826e690d5b70c34880eb6","observation_id":"b1c5defc-e852-4e0f-9cd1-8710f494396f","resolution":{"observed_at":"2026-08-07T11:20:18.225652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:17.908586Z","title":"Preference-based policy learning","venue":null,"work_id":"d34551e6-4daf-4b19-a9c9-53ddad38a1db","year":2011},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.926887Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:b301e2bf7af025473e8974dcd32512a88319cbdbd6f41dc79e37da09348c04b9","observation_id":"4514c777-95fb-45ff-8643-5349d481cee0","resolution":{"observed_at":"2026-08-07T11:20:18.013767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:17.692896Z","title":"sign SGD : Compressed optimisation for non-convex problems","venue":null,"work_id":"8b403406-387f-4c5f-8e1c-b1e40f069fb0","year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.993052Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:1284ca69b9b069d6408f93728fe0aad534fed51d273a97d4196fe2933b8ebd6b","observation_id":"c1086b22-e42f-4c98-8177-ce41ecf25690","resolution":{"observed_at":"2026-08-07T11:20:17.771367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:17.508195Z","title":"sign SGD via zeroth-order oracle","venue":null,"work_id":"50bbbc29-3237-487c-8408-d5d3bf943b5d","year":2019},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.061239Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:491bbf2204e905be310edccab839d2c6bb2afdab812d12d87c846cbcf5ae80ce","observation_id":"4624754b-48f7-4449-9214-3f6e92dee3e3","resolution":{"observed_at":"2026-08-07T11:20:17.561389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:17.347632Z","title":"Thurstone","venue":null,"work_id":"d765321a-0c34-4011-9564-6c0924834138","year":1927},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.109276Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:e261e036ede4a1e908d930047fbe22e6c0d79365df92a7acdc2f8e776b547110","observation_id":"1d23d772-18ad-4127-855e-212208825ea0","resolution":{"observed_at":"2026-08-07T11:20:17.425354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:17.236754Z","title":null,"venue":null,"work_id":"cd8ceac2-b166-4a62-9fea-6970467bc7df","year":2009},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.174397Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:13d1e937443d2965fa675a9c44ae8b135aa2468bd638144f71c374839486a338","observation_id":"6f98a202-ef5e-4072-ac1b-49f50c2593b3","resolution":{"observed_at":"2026-08-07T11:20:17.289639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.228756Z","title":"Reddi, Satyen Kale, and Sanjiv Kumar","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.228756Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:51c7f3d24d0077aa14c71cd5857d8d78e0ac89eac5c5ffcc8e45ece5112d2935","observation_id":"eea2b3cf-b74c-4cc7-b4b3-701a9358fa0b","resolution":{"observed_at":"2026-08-07T11:20:15.228756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:17.055918Z","title":"Online rl in linearly q^ -realizable mdps is as easy as in linear mdps if you learn what to ignore","venue":null,"work_id":"c78da617-e274-4cfa-86d5-d3037d4953be","year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.262179Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:ec99aa480a164e8842dc9c49e9b6474f130536c016fe1bac3ff75ac74e1a3d13","observation_id":"a778a116-10e9-461d-acc1-169b01716d4a","resolution":{"observed_at":"2026-08-07T11:20:17.145625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.790014Z","title":"Sample-efficient reinforcement learning is feasible for linearly realizable mdps with limited revisiting","venue":null,"work_id":"9d58aea8-d413-47a2-9e2c-faac4571f548","year":2021},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.331068Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:18c70a9f3df9d6e46fea768ba69ffaf94cc4d7aa3b14af07b8a16c62f24f935e","observation_id":"35a2cadb-2800-410f-b344-516972a410a6","resolution":{"observed_at":"2026-08-07T11:20:16.927021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.677927Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":"6c95aea5-b3ce-4775-a5b3-506a673efe9e","year":2020},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.383213Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:3977f893a94aeab862f036fd0d8d10f153aefd3d90e314aa806c86556d450a5d","observation_id":"ebf7a969-1673-4a56-a423-dfe76fb3dcca","resolution":{"observed_at":"2026-08-07T11:20:16.706697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:15.443901Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.443901Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:3e3af46bac9a09baf1285e546e08799c702d17e07782197654c418b426d4e7cd","observation_id":"c2d9b706-27a8-433f-a24b-df58a46d0be7","resolution":{"observed_at":"2026-08-07T11:20:15.443901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.531080Z","title":null,"venue":null,"work_id":"bc250e9b-d94c-405c-89ce-48fd95ec64f4","year":2017},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.515429Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:02a3fc251b7b2cf0194eed2274790cbd77ca461c2ed10e8ba937a6e74bcc60e4","observation_id":"a1e85407-5e5e-4403-9f38-41b9ca43909b","resolution":{"observed_at":"2026-08-07T11:20:16.605630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T11:20:15.560054Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.560054Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:ad83d664ca9243238f75777a1b61e11e576b5490d63a15c15c77e444cb1eeb29","observation_id":"23f9ea8d-a73f-4b8a-a799-0a9968480331","resolution":{"observed_at":"2026-08-07T11:20:15.560054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.421844Z","title":"Convex Optimization","venue":null,"work_id":"c6169a69-6a57-4551-9996-9d3101b3fe79","year":2004},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.630602Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:133363a2127e773f4229ed8c9b165a4b037df8f785e04c1638858ce4ac3a8543","observation_id":"7e5ac7ae-8755-4084-8948-5a91bd1a59c4","resolution":{"observed_at":"2026-08-07T11:20:16.471296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.322107Z","title":"Linear convergence of gradient and proximal-gradient methods under the polyak- ojasiewicz condition","venue":null,"work_id":"0da48a68-a41e-4ef8-a67c-f776eca4c614","year":2016},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.682673Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:1a1d1d6f6f6e759f6769c37c890874596d6bf6c96f2812a70e774b85153c418b","observation_id":"ca26ef71-734b-4f3c-ad42-300c2dcf7080","resolution":{"observed_at":"2026-08-07T11:20:16.361093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:20:16.212379Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"38213035-6900-4dbc-ab71-2ea586f8033d","year":2020},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:15.714867Z"},"links":{"citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:e487d490f07d8fb5133a1a2a1dc0f74022a7a7835e12fd3e293e75c4b8307359","observation_id":"9d2fc4c2-5b85-45fa-8a99-90eafaa3e14a","resolution":{"observed_at":"2026-08-07T11:20:16.252160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":44},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 1 inbound Pith citation observation for arXiv:2506.03066."}