{"as_of":"2026-08-08T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a037c44ff5ff84975a18ca606c00db50656c99de0835483efb95aaa24baea41b","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:50.639923Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23927/citation-record","integrity":"/paper/2505.23927/integrity","json":"/paper/2505.23927/citation-record.json","paper":"/paper/2505.23927"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.265551Z","title":"Analysis of thompson sampling for the multi-armed bandit problem","venue":null,"work_id":"d320cb73-0132-4352-a139-42c28b787eef","year":2012},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.472924Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:caf475b472dce0bde633a5a36a12b9e900bca1fbcf0afdc89efea2ed1e5d72f0","observation_id":"e4249897-9122-4b45-8413-d0da2bfbad51","resolution":{"observed_at":"2026-08-07T12:43:57.353799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.113802Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":"7c50f02c-ebc8-4d2d-802d-b4fa1dc874c0","year":2013},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.503626Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:bd74fc17193a4d45de248171c5ba6e50f77c4f1e04940c894332d161b06fede3","observation_id":"20d9d1ba-99c3-4248-8eb1-27b873063592","resolution":{"observed_at":"2026-08-07T12:43:57.169067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.992227Z","title":"Near-optimal regret bounds for thompson sampling.J","venue":null,"work_id":"601861d3-547a-4b39-86e5-332ac1b9ea55","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.527002Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:b8cb51d51ae4cf3eaff141d9d5ca69d74af30037b57865bffe52a5fa94d79328","observation_id":"123a3047-6d7c-4587-b00f-bc2f1b16ed18","resolution":{"observed_at":"2026-08-07T12:43:57.050843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.883752Z","title":"Preference-based online learning with dueling bandits: a survey.J","venue":null,"work_id":"fc492a7e-1a63-44bd-baf8-c2e96aa9a30f","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.557153Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:884b9977427a7123e602eaf9f9cf3b8fa8713265769e9fafb4d38e109565a5ff","observation_id":"ffa5cb5e-80ae-48f0-a949-f154c1aeaa4c","resolution":{"observed_at":"2026-08-07T12:43:56.921778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.811596Z","title":null,"venue":null,"work_id":"e2676e37-8b31-42b1-b539-a316e0de4c41","year":1952},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.588635Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ec323ac058adea123358f80259e6ac5a18078bb40195a7c972f963f822987d49","observation_id":"068d17e4-c7b3-451c-b836-a752a0dd49bd","resolution":{"observed_at":"2026-08-07T12:43:56.839597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-07T12:43:47.614974Z","title":"Michaud, Jacob Pfau, Dmitrii Krasheninnikov, Xin Chen, Lauro Langosco, Peter Hase, Erdem Bıyık, Anca Dragan, David Krueger, Dorsa Sadigh, and Dylan Hadfield-Menell","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.614974Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:a0ace425b2280597e9c21e442ee18d8bb874fdeb3d4469dff0cec744a6a365aa","observation_id":"1c0b73b2-aa5c-49b1-990e-9906ac6bb7ed","resolution":{"observed_at":"2026-08-07T12:43:47.614974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11140","last_updated":"2022-05-24T02:42:19Z","snapshot_observed_at":"2026-08-08T03:49:48.218596Z","submitted_at":"2022-05-23T09:03:24Z","title":"Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11140","snapshot_observed_at":"2026-08-07T12:43:47.660403Z","title":"Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation.arXiv e-prints, page arXiv:2205.11140, May 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.660403Z"},"links":{"cited_paper":"/paper/2205.11140","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:fdc720bbf5527e07ada586db85ce82d6340b00d8c5cb71e100a11e41e054e676","observation_id":"bf60b172-58a5-4b1c-a562-17d5db2b54ab","resolution":{"observed_at":"2026-08-07T12:43:47.660403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01752","last_updated":"2020-01-15T07:19:09Z","snapshot_observed_at":"2026-07-30T10:08:52.387254Z","submitted_at":"2019-07-03T06:15:14Z","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01752","snapshot_observed_at":"2026-08-07T12:43:47.697268Z","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation.arXiv e-prints, page arXiv:1907.01752, July 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.697268Z"},"links":{"cited_paper":"/paper/1907.01752","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:bf07e71b2af8b47f13882d870093c83e40569f26956f99b517455349aa7a13a1","observation_id":"df94777c-9a6c-42ee-a834-a528c133d4c5","resolution":{"observed_at":"2026-08-07T12:43:47.697268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.739631Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"80b76779-4918-4690-bf6a-8273f5df8816","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.725692Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ee634542b05ba2f1dbf6e3b489fcae082a43492a9f757d98ed81997f126fab9b","observation_id":"ec97d09e-1422-4c8e-beb9-24e7242a2e90","resolution":{"observed_at":"2026-08-07T12:43:56.773058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.645130Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment.Transactions on Machine Learning Research, 2023","venue":null,"work_id":"b40d50e6-f490-4a8f-a4c5-83b094045f57","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.755339Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:c578cc89cdf103a6e14e1e16cec8f107b7308a2645e4939c9cc3ef3bc765586c","observation_id":"c3b6e898-2535-472e-bb8e-1f0b4efb17ce","resolution":{"observed_at":"2026-08-07T12:43:56.691296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.554661Z","title":"Schapire, Aleksandrs Slivkins, and Masrour Zoghi","venue":null,"work_id":"702b218c-7eca-4e9d-8604-7d698c5cffe9","year":2015},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.799854Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:dc0bf3c63fbbb86714de70b133c3a511866ad9875424993ee2dcf7c414801ae0","observation_id":"9b05ccd0-1758-4e94-898e-5e4cf8905e2f","resolution":{"observed_at":"2026-08-07T12:43:56.598480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-07T12:43:47.833667Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO.arXiv e-prints, page arXiv:2005.12729, May 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.833667Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:16b59f7517e0957dd8d678fcb8b36ab6dfc4371f134d05c0c0816cc6f536a0fa","observation_id":"19324a54-6076-42a7-9974-d420050cd73f","resolution":{"observed_at":"2026-08-07T12:43:47.833667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.484689Z","title":"Foster and Alexander Rakhlin","venue":null,"work_id":"d1526974-51f6-4628-a722-b178b693a7b0","year":2020},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.872516Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d177b4b6b984412c160cb636c1ef311dc04757064296b4dd47c288640a6bacf5","observation_id":"3b0a6cb4-d055-45c1-963e-d178d68d1d07","resolution":{"observed_at":"2026-08-07T12:43:56.515634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.418217Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"9af1fc1b-7d9b-4222-b549-20e7ed668bdf","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.899602Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:9c1ff131351bed25c047735e080a3d28743fa92c111412ff780216865a20d31e","observation_id":"7e17df10-3712-4376-ba25-69acb9567738","resolution":{"observed_at":"2026-08-07T12:43:56.445967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-07-06T16:35:07.121479Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-07T12:43:47.923648Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.923648Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:db4617b484de218cc4319a9372284a62391f5f7fd55ff2180ca38bc81a52fb3f","observation_id":"f93d914f-0c4c-473a-82e8-2c013645e3ae","resolution":{"observed_at":"2026-08-07T12:43:47.923648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T12:43:47.949387Z","title":"Reinforced Self-Training (ReST) for Language Modeling.arXiv e-prints, page arXiv:2308.08998, August 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.949387Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:349ab6349c926fef5c01d2abd52f5d3e20486e2961a10098fc4e7b93a5b01505","observation_id":"e83e8437-ccdd-42d5-b84d-f82d4a42da7e","resolution":{"observed_at":"2026-08-07T12:43:47.949387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07841","last_updated":"2021-10-25T19:43:52Z","snapshot_observed_at":"2026-07-06T11:19:18.563623Z","submitted_at":"2021-06-15T02:23:07Z","title":"Randomized Exploration for Reinforcement Learning with General Value Function Approximation","version":2},"cited_work":{"arxiv_id":"2106.07841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07841","snapshot_observed_at":"2026-08-07T12:43:51.626586Z","title":"Randomized Exploration for Reinforcement Learning with General Value Function Approximation","venue":"cs.LG","work_id":"9d82ba49-ce4e-440e-b7cf-5e09bed6632a","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:47.982915Z"},"links":{"cited_paper":"/paper/2106.07841","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d98c1f209f3bc210f19e9f1a814adf2565b90bd75c6045ec2e3a43e45331f09f","observation_id":"577cacf1-c0d0-4a3d-81be-5207f551a71d","resolution":{"observed_at":"2026-08-07T12:43:51.698037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18246","last_updated":"2024-03-18T00:37:12Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:11:28Z","title":"Provable and Practical: Efficient Exploration in Reinforcement Learning via Langevin Monte Carlo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18246","snapshot_observed_at":"2026-08-07T12:43:48.010070Z","title":"Rupam Mahmood, Doina Precup, Anima Anandkumar, and Kamyar Azizzadenesheli","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.010070Z"},"links":{"cited_paper":"/paper/2305.18246","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d1d91635decba9880849edeffddc38596f0440ee0fe89655646028369999c6a1","observation_id":"f297a784-efaf-4ffe-89e3-7dcd0598597c","resolution":{"observed_at":"2026-08-07T12:43:48.010070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.345769Z","title":"Learning trajectory preferences for manipulators via iterative improvement","venue":null,"work_id":"57385f0c-8b5b-45a8-84e7-ee7a50e45cc0","year":2013},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.044855Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:f9fa16fdc4635a9e514860dea0e8c23321c55d4f70055b14cb572cef797570b2","observation_id":"c42b36f4-36c4-48c0-91b7-2a61f39d6dd5","resolution":{"observed_at":"2026-08-07T12:43:56.372101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.245154Z","title":"Schapire","venue":null,"work_id":"47bb33da-f747-4cd1-a088-4dfa5572315e","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.086054Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d114fd181aa8de138e366c161709a2991161468d3e31776a305def6d5eedd2be","observation_id":"8fcfabfa-f0f1-4928-b963-d64cda7e98fd","resolution":{"observed_at":"2026-08-07T12:43:56.305869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.101299Z","title":"Bellman eluder dimension: new rich classes of rl problems, and sample-efficient algorithms","venue":null,"work_id":"d0850cb4-f3d2-44a4-94de-0b94d212ed53","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.220473Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:92122fac0d547c7cb55a547fa88dcb297eecb61018308753bcc1984056e744f4","observation_id":"8d7c2828-6114-47ee-9b1c-75a721be65d2","resolution":{"observed_at":"2026-08-07T12:43:56.160284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02691","last_updated":"2019-12-11T17:33:13Z","snapshot_observed_at":"2026-07-06T07:58:30.747165Z","submitted_at":"2019-06-06T16:35:38Z","title":"An Introduction to Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02691","snapshot_observed_at":"2026-08-07T12:43:48.246384Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.246384Z"},"links":{"cited_paper":"/paper/1906.02691","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:90dff8ce0f3c1948c37c11276500e626768db8da5228551eae119173c15e28dc","observation_id":"0c2c094a-4035-4108-932e-73172d5f9e74","resolution":{"observed_at":"2026-08-07T12:43:48.246384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18438","last_updated":"2023-07-03T13:08:46Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T01:18:39Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18438","snapshot_observed_at":"2026-08-07T12:43:48.277156Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism.arXiv e-prints, page arXiv:2305.18438, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.277156Z"},"links":{"cited_paper":"/paper/2305.18438","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:c71424f369c57d6d4fd40e43bc8c295d388da14231b508623d4ed638855b5463","observation_id":"42031251-04a4-4d60-98f6-1d92937d10ec","resolution":{"observed_at":"2026-08-07T12:43:48.277156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-07T12:43:48.349648Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.349648Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:720b809aa4bcc7e6843f5994efb1a44169bc4d490a62c8e46c6bb01cff9e6738","observation_id":"f0776b47-d595-408d-8199-0e20cbb831ad","resolution":{"observed_at":"2026-08-07T12:43:48.349648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-07-31T03:53:01.450978Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T12:43:48.431444Z","title":"Liu, and Jialu Liu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.431444Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:f87db01697fba5a46da1c10219220f66d6f09f9475bf368763a07f91e72cd1cb","observation_id":"5e9a7c7f-6d8b-48bb-a13c-f3dd10c93cb9","resolution":{"observed_at":"2026-08-07T12:43:48.431444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.883047Z","title":"Roberts, Matthew E","venue":null,"work_id":"17b28c78-9205-4737-ae1e-f118d6ca0721","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.478015Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:b8b264c9e03a0a5193c5dc673d3e1d132400f7f216e3a611cba5767e6a610746","observation_id":"2d07115f-7ad9-4934-859e-b3cfd268c94f","resolution":{"observed_at":"2026-08-07T12:43:55.983442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01289","last_updated":"2020-06-29T16:09:49Z","snapshot_observed_at":"2026-08-08T13:28:57.729025Z","submitted_at":"2019-08-04T07:51:36Z","title":"Dueling Posterior Sampling for Preference-Based Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01289","snapshot_observed_at":"2026-08-07T12:43:48.515394Z","title":"Novoseller, Yanan Sui, Yisong Yue, and Joel W","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.515394Z"},"links":{"cited_paper":"/paper/1908.01289","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:f6c6e9907b16da1109c4e93c5ba6eb9521f1a4eb7672fae9c0f1c8084e86f08c","observation_id":"99e536a6-804c-4e8e-9d7d-6a8133fa2060","resolution":{"observed_at":"2026-08-07T12:43:48.515394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:43:48.557964Z","title":"Pong, Tolly Powell, Alethea Power, Boris Power, Elizabeth Proehl, Raul Puri, and Alec Radford","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.557964Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:25754fe543b44e7e6b76fd0216f68b90baf190102ac1a8628011350ad987e5e6","observation_id":"d2dfc404-e7b3-4272-a6ce-8e481e070dfe","resolution":{"observed_at":"2026-08-07T12:43:48.557964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.607303Z","title":"Randomized prior functions for deep reinforcement learning","venue":null,"work_id":"aa4d6ab0-e562-43cb-8acd-d0080f64f784","year":2018},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.595572Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:692e6bedfb51ff2df26da9cd00d292b5a4ae38904d1944b6cbc0bd9bb26fb69d","observation_id":"d119f7ce-7e96-44a5-8ae4-32de28a7a17b","resolution":{"observed_at":"2026-08-07T12:43:55.724220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.341657Z","title":"Approximate thompson sampling via epistemic neural networks","venue":null,"work_id":"45457af3-bdf2-4aeb-9a62-4069327ce757","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.687662Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:a902ab8b48ca8826484281f040e8084663f0378f9048bbeab20a0f1a75ccdc38","observation_id":"49fef49c-a677-43d7-aabc-9d0303095e41","resolution":{"observed_at":"2026-08-07T12:43:55.458395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.239396Z","title":null,"venue":null,"work_id":"0c343eff-74f2-4f7f-810c-b24f3c759ae4","year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.737226Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ae3b8d1569c82a82309662edc52f73b561488d90a7da3eea6d142eae3accdb87","observation_id":"a4149ebe-e20f-44e2-98f4-d8e5ea133972","resolution":{"observed_at":"2026-08-07T12:43:55.265065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T12:43:48.769424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.769424Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d3a704afa981512517c9dafb97bc97f4ca968609284d721167f4a39b3eed32be","observation_id":"6f9f557f-4443-4c58-8032-dc79c85f99d1","resolution":{"observed_at":"2026-08-07T12:43:48.769424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T12:43:48.796716Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.796716Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:bc229851441434975ec37d418e2349a63696e977011ed23eff1a1e033085ab54","observation_id":"861b40f8-ed0f-40de-9e17-2b78ec60c871","resolution":{"observed_at":"2026-08-07T12:43:48.796716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02870","last_updated":"2019-08-16T22:43:53Z","snapshot_observed_at":"2026-07-06T07:58:36.769011Z","submitted_at":"2019-06-07T02:36:00Z","title":"Worst-Case Regret Bounds for Exploration via Randomized Value Functions","version":3},"cited_work":{"arxiv_id":"1906.02870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02870","snapshot_observed_at":"2026-08-07T12:43:51.225927Z","title":"Worst-Case Regret Bounds for Exploration via Randomized Value Functions","venue":"cs.LG","work_id":"8d6f1ee9-dc10-4f41-8838-06371b07b191","year":2019},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.814525Z"},"links":{"cited_paper":"/paper/1906.02870","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:5b7aed63ab421fae450bd27e30597503ee8598a6fb1be6e712895ea67d05a537","observation_id":"211392fb-78f6-416f-88c2-2596ae83e015","resolution":{"observed_at":"2026-08-07T12:43:51.321069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.160843Z","title":"Learning to optimize via posterior sampling.Math","venue":null,"work_id":"5a638c5e-1740-4061-9b9b-48142035b256","year":2014},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.838269Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:96a23a8ca3e0ec1247985b7ad0309286ce3e669b8c133e252d6c8f8ce8ae276e","observation_id":"55c69687-57ec-4809-8c77-83e041a8c371","resolution":{"observed_at":"2026-08-07T12:43:55.197918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.039512Z","title":"Optimal algorithms for stochastic contextual preference bandits","venue":null,"work_id":"30a31517-bf31-4f40-ba26-5fb221a863e7","year":2021},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.861004Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:88afe2bc0681f892a2b7482c39745c6b08b9b202eee8224f31ad94a0f20ddfaa","observation_id":"bc4131b1-1e3a-4dc0-9db7-ff14eb6c686a","resolution":{"observed_at":"2026-08-07T12:43:55.096880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.652338Z","title":"Efficient and optimal algorithms for contextual dueling bandits under realizability","venue":null,"work_id":"5ab25424-e5a0-4196-bd3c-aebfaf981d3e","year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.890800Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:355e0b13c84436447ede5d8b1a7e16bf981a207cdd38582fd2dd7f386dccf904","observation_id":"d14f95a0-6435-44a0-ad5c-650065971df0","resolution":{"observed_at":"2026-08-07T12:43:54.840829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.235512Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":"c94a39ce-1345-4b44-8b49-3b77af19cf97","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.921797Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:fb244d185918bd8e5dd866d613258492256d4f943c04d02c27cc0b2593a00dd4","observation_id":"96c7ef00-ab1d-4d6b-afc8-59b1df7108b3","resolution":{"observed_at":"2026-08-07T12:43:54.465692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:43:48.940005Z","title":"Proximal Policy Optimization Algorithms.arXiv e-prints, page arXiv:1707.06347, July 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.940005Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:2788c7a9292ae9e010ae9fefe6bbc61987ead711c7bdf266d459bf206a23c399","observation_id":"49191887-b0d3-43ff-95e7-cb122383c61b","resolution":{"observed_at":"2026-08-07T12:43:48.940005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.013352Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"0aa00424-17b6-4582-933d-b0b4c729472c","year":2020},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.969661Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:45bc00a07d587353a0a3816fdff68aaa8cf78d0e0c1002b0bea3690a72567f32","observation_id":"279c74ef-69af-4a5a-80c5-1c6e4b99451a","resolution":{"observed_at":"2026-08-07T12:43:54.117813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.859852Z","title":"Thompson","venue":null,"work_id":"0c9ff017-45ee-4cc2-8ede-f60d1f726d72","year":1933},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.992418Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:8eb6f02e6da351e514bf34896c4da7a7d17686b018dba89bd972b28ef87e1609","observation_id":"fa5d1bcb-9c9a-48b3-8d23-0f6bb19a2314","resolution":{"observed_at":"2026-08-07T12:43:53.933023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:43:49.018024Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models.arXiv e-prints, page arXiv:2307.09288, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.018024Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:0282e79290dd3cd7958dd865b2f739a8a267d3dee957900d35cb492342e61a25","observation_id":"d0e6e6ee-2a2d-4ea5-9d0c-675fddd8b452","resolution":{"observed_at":"2026-08-07T12:43:49.018024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.753165Z","title":"van de Geer","venue":null,"work_id":"40d4297e-d6c6-4ad3-b13d-aa000dbe2789","year":2000},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.052190Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d432d317978a2d1a2f61f287a7d4421103dedf8ab6cf1c6f67ac2260735416d5","observation_id":"5ade00be-bf41-4888-ae26-23ff03ca7444","resolution":{"observed_at":"2026-08-07T12:43:53.773838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T12:43:49.083529Z","title":"Beyond Reverse KL: Gen- eralizing Direct Preference Optimization with Diverse Divergence Constraints.arXiv e-prints, page arXiv:2309.16240, September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.083529Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:fa0c15ea9b17a034ecbcbd85bb87353bc34b52a25f602462e46a8f448cbcf8e2","observation_id":"76980b50-eb90-47f5-9a42-dc7bc440db34","resolution":{"observed_at":"2026-08-07T12:43:49.083529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.688475Z","title":"Thompson sampling for combinatorial semi-bandits","venue":null,"work_id":"bf65e9d1-185e-43b2-b0ef-7b7a5c6709b8","year":2018},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.108031Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:b1b16dd2375bcd3dc971041cb9089b9b1dda631648511be593cdb630b6f1cf9d","observation_id":"7f75d0cc-fa25-45bd-bef3-aa7b602e3ef7","resolution":{"observed_at":"2026-08-07T12:43:53.720079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.519666Z","title":"Is rlhf more difficult than standard rl? a theoretical perspective","venue":null,"work_id":"33ff630d-2181-4a34-8c2e-8da7d3c61072","year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.117791Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:bbe5d28664823ded034dfbb733abe62a2839e7131e7ac7120ecdec9a6e2a99e1","observation_id":"66e2e15c-29c5-4fef-b039-035424f36808","resolution":{"observed_at":"2026-08-07T12:43:53.586179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.428313Z","title":"A survey of preference-based reinforcement learning methods.Journal of Machine Learning Research, 18(136):1–46, 2017","venue":null,"work_id":"d0de25bc-976b-4888-9c3d-95792db88465","year":2017},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.197952Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d9254c038d64fa898a2d3f77e20a764c783328f420af3dd569c79c682db39807","observation_id":"32e371bb-2530-41ee-91aa-d4f60570624f","resolution":{"observed_at":"2026-08-07T12:43:53.466104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14554","last_updated":"2024-03-12T21:49:59Z","snapshot_observed_at":"2026-07-06T16:36:55.519052Z","submitted_at":"2023-10-23T04:19:35Z","title":"Making RL with Preference-based Feedback Efficient via Randomization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14554","snapshot_observed_at":"2026-08-07T12:43:49.305402Z","title":"Making RL with Preference-based Feedback Efficient via Randomization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.305402Z"},"links":{"cited_paper":"/paper/2310.14554","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:f1b614840ac046395d105771440b08cdecdea53ff730bb35c6c15bf3ddb5c42f","observation_id":"aaaeabf1-1a17-4283-b3f8-afbfa8d4821b","resolution":{"observed_at":"2026-08-07T12:43:49.305402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.198669Z","title":"Borda regret minimization for generalized linear dueling bandits","venue":null,"work_id":"f7c7d237-0255-403b-9507-5c8e431b8a07","year":2024},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.376621Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:599e17eb3da62621ffba9cf91a9a4fb7807a710e92bfef0a3010711546b8394c","observation_id":"3bff1bf3-7f85-42d6-9c5b-5fa3c5a8987b","resolution":{"observed_at":"2026-08-07T12:43:53.309730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-07T12:43:49.435213Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint.arXiv e-prints, page arXiv:2312.11456, December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.435213Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:e1053ef039de9bde3922c6a72888c44f96ec29a60f10e421fa0969ed3c5f4c3d","observation_id":"d633d1f9-2b01-4aa8-929c-e316d7ca4f71","resolution":{"observed_at":"2026-08-07T12:43:49.435213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.070362Z","title":"Near-optimal randomized exploration for tabular markov decision processes","venue":null,"work_id":"c7d01275-407b-49ff-b3f9-91581ab78571","year":2022},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.519282Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ac14e93f5a9d2838c7a1a34c7931e6510489cce443835b54cdca4539cdd80c22","observation_id":"50e372fb-8206-41ca-be88-96913864589f","resolution":{"observed_at":"2026-08-07T12:43:53.149868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.829155Z","title":"Yang, Aarti Singh, and Artur Dubrawski","venue":null,"work_id":"88f38575-ca7b-42ef-8595-963a2e59ad5c","year":2020},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.630519Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:e68d0dbde1d217a8c2b62d2b2541f9c4f29e25dce8855d96a4f112161070900e","observation_id":"358a7f11-bc21-4f36-ae13-e03d2f64e846","resolution":{"observed_at":"2026-08-07T12:43:52.943796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-04T23:38:14.844517Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T12:43:49.730231Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears.arXiv e-prints, page arXiv:2304.05302, April 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.730231Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:ce595d3af54af1549be69d962266b6ec6297ce3653d1609f3ddf748c0a65f7ba","observation_id":"2224a913-2e3b-4ce0-89b8-bb0c530ca86a","resolution":{"observed_at":"2026-08-07T12:43:49.730231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.595662Z","title":"The k-armed dueling bandits problem.Journal of Computer and System Sciences, 78(5):1538–1556, 2012","venue":null,"work_id":"3a20d436-316f-4f4d-9079-2a41d47d6502","year":2012},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.832227Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:5fe3778076a1fbae35d1afa41de1243ddef08147e091615e866b3002cf4dff2c","observation_id":"efdf6433-3dac-4f16-8619-95bc291194bb","resolution":{"observed_at":"2026-08-07T12:43:52.725910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00567","last_updated":"2023-09-08T16:34:55Z","snapshot_observed_at":"2026-07-06T08:34:10.366215Z","submitted_at":"2019-11-01T19:48:57Z","title":"Frequentist Regret Bounds for Randomized Least-Squares Value Iteration","version":7},"cited_work":{"arxiv_id":"1911.00567","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.00567","snapshot_observed_at":"2026-08-07T12:43:50.879889Z","title":"Frequentist Regret Bounds for Randomized Least-Squares Value Iteration","venue":"cs.LG","work_id":"80ea8c66-bfd9-4f87-b27d-3088defc0280","year":2019},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:49.926426Z"},"links":{"cited_paper":"/paper/1911.00567","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:38effcc055c141d76e8f389f9811ba30c13ec53ac9806b6b647410d8426a55af","observation_id":"74185e95-b077-4d1a-8ed4-77e557bb356e","resolution":{"observed_at":"2026-08-07T12:43:50.963293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T12:43:50.030374Z","title":"Lee, and Wen Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.030374Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:a0d3a38833e48ddf130e6d3253622c990e6b7201f48c39c80f22d1152aac8652","observation_id":"be121500-6594-443b-9b65-15b395ac386f","resolution":{"observed_at":"2026-08-07T12:43:50.030374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.399533Z","title":"Lee, and Wen Sun","venue":null,"work_id":"18b0ae9b-f819-406a-822e-ce13338c2c6a","year":2024},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.138027Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:20c4f1b7e7c6e611f22d512f5ca9723ea186d06dd17554f2012b0076668964d3","observation_id":"52573980-9b4b-4c97-91d0-417248f344a7","resolution":{"observed_at":"2026-08-07T12:43:52.502747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T12:43:50.251391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.251391Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:d28230d1711dd90dd4b32a5463074014e35d7c3161915084f99e0215a81e13af","observation_id":"0b8a432e-e368-4c56-b05f-05153a48c8e2","resolution":{"observed_at":"2026-08-07T12:43:50.251391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02231","last_updated":"2023-11-02T22:47:14Z","snapshot_observed_at":"2026-07-06T15:37:39.433980Z","submitted_at":"2023-06-04T01:59:40Z","title":"Fine-Tuning Language Models with Advantage-Induced Policy Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02231","snapshot_observed_at":"2026-08-07T12:43:50.418201Z","title":"Jordan, and Jiantao Jiao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.418201Z"},"links":{"cited_paper":"/paper/2306.02231","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:88d960222ae82cbd828997e18c7b3c754df06c63d0ed524ee34fa9ad76647611","observation_id":"03c377c5-e3ab-436d-8210-6ccd562be404","resolution":{"observed_at":"2026-08-07T12:43:50.418201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.187796Z","title":"Efficient active learning with abstention","venue":null,"work_id":"9cbd0769-243a-4c1c-84f3-2c23ea8bf541","year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.546951Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:4926d72e72dad9aa40e714aee34ecae8ae3248f5147af5690577f15efc05a4cd","observation_id":"77e137d6-8164-40ce-abb3-10a5008f955d","resolution":{"observed_at":"2026-08-07T12:43:52.301764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:51.951757Z","title":null,"venue":null,"work_id":"b319b761-36d5-4657-b61f-8d282a157b1c","year":null},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.639923Z"},"links":{"citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:becfb0655880d03d93f2448e28aa35517a18e5acf87aed8101a294bff288ecfd","observation_id":"b14aa731-9812-46c9-a59b-4c5cdea52644","resolution":{"observed_at":"2026-08-07T12:43:52.029084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":31},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.23927."}