{"as_of":"2026-08-08T08:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b772793882f8d1d0b2b9ddd025bf8c86ca243ff2e15da06ed7fb8b00f27e9362","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:45.634287Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23673/citation-record","integrity":"/paper/2505.23673/integrity","json":"/paper/2505.23673/citation-record.json","paper":"/paper/2505.23673"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.878545Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:39.878545Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:88a45c9c41704e098543841097a85ad66e3dc1ba0aaf9727d4c25a527a2041f2","observation_id":"cbb2eea2-eefa-4813-a6ce-abe16523ff2b","resolution":{"observed_at":"2026-08-07T12:50:39.878545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.955294Z","title":"Online learning for linearly parametrized control problems","venue":null,"work_id":"ce0a8575-209e-4b06-b4a0-944e6d16b314","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:39.976257Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:67e3c4f5dfe9eb9a2752c165c95fd7de1379e84d9cbb0e30192837b94551fd49","observation_id":"f25d9bbb-539f-4ffa-a943-5380cdd1e2ee","resolution":{"observed_at":"2026-08-07T12:50:57.055986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.822942Z","title":"Reducing dueling bandits to cardinal bandits","venue":null,"work_id":"448f147b-cb92-494e-9bb0-5ba121ad1ed9","year":2014},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.043920Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:44bae7e3f2ded93131972aba692ca22fd29cba7bf703b36b329cb8e204b888f8","observation_id":"f63f9162-3596-4bc2-b4e7-b14c5fb6ed7d","resolution":{"observed_at":"2026-08-07T12:50:56.865663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.138320Z","title":"S., Hu, W., Li, Z., Salakhutdinov, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.138320Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:73f0364283c2df90a9e355afaae8fc19acc1861375724948d06dc0993cf3e18e","observation_id":"c916829b-9808-4ebb-a0ce-b4bda5cf7a20","resolution":{"observed_at":"2026-08-07T12:50:40.138320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.588433Z","title":"R., Daulton, S., Letham, B., Wilson, A","venue":null,"work_id":"e7bacd82-cd76-4641-b9f4-4367f73815fd","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.241854Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:0ddd072560cabace017aa415b44891b7e99c005bda09c49608ef873a1460c6ae","observation_id":"661e7698-f079-457d-91a0-dcbd759a411c","resolution":{"observed_at":"2026-08-07T12:50:56.750917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.286366Z","title":"Preference-based online learning with dueling bandits: A survey","venue":null,"work_id":"580201fe-f87d-4f38-ad8f-616374aa73ad","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.361927Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:4f56b4aaa4524f4582cfc8d72a7ff09760ec51e4df284654ebca18eef2245efb","observation_id":"3c8de591-d8e2-458b-9040-58d0cb36bd85","resolution":{"observed_at":"2026-08-07T12:50:56.449269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:56.107674Z","title":"Stochastic contextual dueling bandits under linear stochastic transitivity models","venue":null,"work_id":"bf5b119e-50ab-4365-aef5-4ce557882dcc","year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.442785Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:c2e0332c5d7d3e0aaef529aff42342a3956dd332bd5511a360aa6f06c7f3885f","observation_id":"3b08b2bb-24a7-42e8-af6a-df979b24cc66","resolution":{"observed_at":"2026-08-07T12:50:56.187735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:55.869376Z","title":"Mat \\'e rn gaussian processes on riemannian manifolds","venue":null,"work_id":"1fad2ea8-a426-4204-bf30-2d3508d348ed","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.521123Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b8fe1382e2c858f397515dfbfd9ce4c86ffc95ca979567ea074611b90d7b3340","observation_id":"c5f9d829-ad58-45fd-b147-a251fe5e750a","resolution":{"observed_at":"2026-08-07T12:50:55.922717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.628781Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.628781Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:8d043b2ef09dba5a510cdb66cc3d5747e20593a74ffb0223c2eef73af4e0721a","observation_id":"1cbd7aa1-5dfe-4a1d-9f66-859d3c207769","resolution":{"observed_at":"2026-08-07T12:50:40.628781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1012.2599","last_updated":"2010-12-12T22:53:04Z","snapshot_observed_at":"2026-07-06T02:20:34.514024Z","submitted_at":"2010-12-12T22:53:04Z","title":"A Tutorial on Bayesian Optimization of Expensive Cost Functions, with Application to Active User Modeling and Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1012.2599","snapshot_observed_at":"2026-08-07T12:50:40.734979Z","title":"M., and De Freitas, N","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.734979Z"},"links":{"cited_paper":"/paper/1012.2599","citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3b77a7a0413642567128369be75fd9fb3ae8d6c531efa40c675cdd782d9fdda0","observation_id":"d1b04aac-25ff-468c-a4f1-279ce8a31e28","resolution":{"observed_at":"2026-08-07T12:50:40.734979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:55.555948Z","title":"Instructzero: Efficient instruction optimization for black-box large language models","venue":null,"work_id":"2260f282-0535-4a37-a29c-f6d297954680","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.835746Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:1fae537e3498fc596aac1ba54a94000b743536b95cd8e5a84163db693abc6b1f","observation_id":"eb9496c5-f672-4075-a016-e37658ba9289","resolution":{"observed_at":"2026-08-07T12:50:55.729489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.901099Z","title":"Human-in-the-loop: Provably efficient preference-based reinforcement learning with general function approximation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.901099Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:5a0a1a0cc1f9557252e336cb8cc2659d2ba074e7585673562c3f8191ddacb6e4","observation_id":"72f068b0-e951-4dec-aabc-ef40b7e314d5","resolution":{"observed_at":"2026-08-07T12:50:40.901099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:55.181231Z","title":null,"venue":null,"work_id":"6fed1a5e-1628-4c75-aed8-9310fcd1c5b9","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:40.994901Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:c18f36b629f907d7ec4b7f095aaed271946350e2b47c2c37ad1aa20651b4dd93","observation_id":"cd4f5627-73e6-42a9-9a40-4be5c0d094e4","resolution":{"observed_at":"2026-08-07T12:50:55.354090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:54.902670Z","title":"and Steinwart, I","venue":null,"work_id":"906fd6c8-5add-4685-a6e1-753040bd302e","year":2008},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.069695Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:6ef44840b6e409f9d25f5ba614bb0bcb29560468baff220c8c7c0684a6ea7c5c","observation_id":"3a2067e6-4446-4226-8812-ca1d198dd0cc","resolution":{"observed_at":"2026-08-07T12:50:55.009181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:54.626290Z","title":null,"venue":null,"work_id":"9ffcabf7-22ab-48bc-9e71-893c891c7862","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.168084Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:e8733b2c9fbe4021676a17436e8ef494278a606428a91de0faa19f4d92d01aeb","observation_id":"bf1ae0a8-8f2e-4f09-9963-fb340e6a3851","resolution":{"observed_at":"2026-08-07T12:50:54.743049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:54.264489Z","title":"E., Slivkins, A., and Zoghi, M","venue":null,"work_id":"76cc78fa-ff8b-437d-ae55-7ed7f6da1d89","year":2015},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.269844Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:51b330df2fc936e9864e20d4a446a4a7054413e37be7d2a699d3a38c11b83a6c","observation_id":"6dd47c75-eda3-44a6-93c1-9020fbd86d56","resolution":{"observed_at":"2026-08-07T12:50:54.433457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.905230Z","title":null,"venue":null,"work_id":"a8c90170-c7c6-488d-b1fe-f69cc059fff4","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.351047Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:97c2cf2f962c2c601dd0b6ebbceb166be148c849ee26bd7310d09d36dae0861d","observation_id":"279f94d4-b194-4864-b290-d74173a76ca7","resolution":{"observed_at":"2026-08-07T12:50:54.070394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.626725Z","title":"Improved optimistic algorithms for logistic bandits","venue":null,"work_id":"98b041c2-6b6b-4ec7-8b3e-02147ac093c6","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.453532Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:aaa1652d130f1f5cf056c3a75cc2b440f55b9e2dd3db9d963495cd0ce84f6202","observation_id":"90cc3a77-2405-4f42-bf4c-0d4f49d85df7","resolution":{"observed_at":"2026-08-07T12:50:53.772960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02811","last_updated":"2018-07-08T13:06:26Z","snapshot_observed_at":"2026-08-07T12:49:05.688504Z","submitted_at":"2018-07-08T13:06:26Z","title":"A Tutorial on Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02811","snapshot_observed_at":"2026-08-07T12:50:41.544682Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.544682Z"},"links":{"cited_paper":"/paper/1807.02811","citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:fd07e74b032829acc1e592054767a07380d033c74b5699a0ac96d13a74f36879","observation_id":"3fd1dca9-b811-4db7-8ba6-edaa73054cf9","resolution":{"observed_at":"2026-08-07T12:50:41.544682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.362846Z","title":"R., Pleiss, G., Bindel, D., Weinberger, K","venue":null,"work_id":"142cbbd8-5736-4ce3-9122-20ee339f18e8","year":2018},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.638418Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:f9eb72704622db0e24ae954a1c982932dbd6362fc766e8103bba610436f3dbf5","observation_id":"18fce1e8-13d2-40ae-9586-1d9ec0b24e46","resolution":{"observed_at":"2026-08-07T12:50:53.480243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:53.061553Z","title":null,"venue":null,"work_id":"f800bd32-9c4b-46cb-b198-0d818a5ae1af","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.704728Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:e526d870a123edc85c94b6b67cba8216841295c716d5efa61a266e091c53c602","observation_id":"b5164a3c-46a1-4518-9082-846da787c71c","resolution":{"observed_at":"2026-08-07T12:50:53.193134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:52.734546Z","title":"L., and Thomaz, A","venue":null,"work_id":"706e7fc8-267b-4a6e-824f-ca1b59ba4c71","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.773886Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:12161cabfe954814add3c3e2e6f374cd26de3be76f51847aded17455c2358522","observation_id":"1cc4fddb-d77a-422f-bbb7-62bba9674992","resolution":{"observed_at":"2026-08-07T12:50:52.899224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:52.493125Z","title":"and Yang, X.-S","venue":null,"work_id":"6039a26e-391b-4ae4-ad7d-a867b5f73bac","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:41.930302Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:4b0def897e726bb3a180e7befedca7a0473a4541cfe3324973177df7a54424d6","observation_id":"f82de9f4-ae72-47bb-a88c-9b04475e04bf","resolution":{"observed_at":"2026-08-07T12:50:52.600042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:42.054479Z","title":"R., Schonlau, M., and Welch, W","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.054479Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:645f6010fb02aa409c924f0fc3272f77b40d8c03b69951d6f7b9224046e3f76f","observation_id":"dad41594-2365-4926-9a1e-5a488c4bb929","resolution":{"observed_at":"2026-08-07T12:50:42.054479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:52.230911Z","title":"Feel-good thompson sampling for contextual dueling bandits","venue":null,"work_id":"e8e7f56d-0cfb-461a-92aa-925b4f96fede","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.145030Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:2c65e363162c55f5793f39322a0c78e43db87ed8a2a37665a5befcbbf636d51d","observation_id":"807202dd-e4de-4525-b1ca-f3f9eeb24320","resolution":{"observed_at":"2026-08-07T12:50:52.335804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.976296Z","title":"and Scarlett, J","venue":null,"work_id":"13146126-4850-418d-bd92-f49988189201","year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.274206Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:d00f3967f09cece1b0f2ad6cde6a0edc77cda06f85f5b36dc3ffbf78baa11479","observation_id":"70eed8b9-bb8e-4b6d-b810-cfc21206ee71","resolution":{"observed_at":"2026-08-07T12:50:52.109171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.757814Z","title":null,"venue":null,"work_id":"3d404248-6728-4636-a3d7-88e1f781ff1e","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.368045Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:34bbd7144cdca3dfc8fed418addda057d1ea075691b14c46aa3513e82474df6c","observation_id":"6fa7c559-fe37-473b-916b-3147b64858b7","resolution":{"observed_at":"2026-08-07T12:50:51.870471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.475990Z","title":null,"venue":null,"work_id":"68cebd78-a800-455d-b9de-d6f37e458b69","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.497274Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:6153d8e8d568a890bd0569abb2c1a24169b9d5f84ff0fa1ba785f6fa9fb194a1","observation_id":"c52c829c-9edc-4326-9bd9-17ec706ccd74","resolution":{"observed_at":"2026-08-07T12:50:51.603727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00267","last_updated":"2025-03-20T14:23:17Z","snapshot_observed_at":"2026-07-06T16:55:25.413169Z","submitted_at":"2023-12-01T00:54:02Z","title":"Sample Efficient Preference Alignment in LLMs via Active Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00267","snapshot_observed_at":"2026-08-07T12:50:42.595875Z","title":"Sample efficient reinforcement learning from human feedback via active exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.595875Z"},"links":{"cited_paper":"/paper/2312.00267","citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:542b16b07a30d332fb37fc8e5621e33119351eb4c0c7213a739c29d714c66e80","observation_id":"3e05f0f4-440a-4c96-815a-b223275df31c","resolution":{"observed_at":"2026-08-07T12:50:42.595875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:51.176200Z","title":"Kernelized offline contextual dueling bandits","venue":null,"work_id":"d907dbce-0b2f-47b5-b68b-1476de9ac7a5","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.722443Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:e28924172c5e148f8aee9f639a73e7fdf28311ebb56db038d69fd3cfa5e4c188","observation_id":"05359119-0546-450b-85ca-779f84c2d013","resolution":{"observed_at":"2026-08-07T12:50:51.302536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.980394Z","title":"Functions of positive and negative type, and their connection with the theory of integral equations","venue":null,"work_id":"9cfd0ae4-de8d-44ab-92ae-e5d33b0cc20e","year":1909},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.844443Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b3af3e219a2f763c0ca244b92088e7269701be0855dc707e382aac0f5966183e","observation_id":"5a862fc4-f9e7-4c39-a3ff-b6c87c6ebf2d","resolution":{"observed_at":"2026-08-07T12:50:51.069454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.781160Z","title":"Projective preferential bayesian optimization","venue":null,"work_id":"8db2777f-09a1-4e37-a5f3-6868ec3ee809","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:42.936733Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:9720585cbfee5c1062136dc2ea9118380fcd13a899c6a98463af82b5bdd038a1","observation_id":"1ce9876e-4bd5-4bb8-86be-301ac54aa385","resolution":{"observed_at":"2026-08-07T12:50:50.884143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:43.040733Z","title":"Dueling posterior sampling for preference-based reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.040733Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:761c28c3c851ced8f0e960c64afb2860d55800bdcb2d4176d79cf5ad701cb659","observation_id":"849b6473-3f9d-4ee8-883c-119846cf8701","resolution":{"observed_at":"2026-08-07T12:50:43.040733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:43.162585Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.162585Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:c3a20f0b885e8956f8e0e4b21a7cb683c8ed4f8ad988bbb578979cff1b18dc7d","observation_id":"8646b46f-3fbe-4102-89a5-ea926abb3064","resolution":{"observed_at":"2026-08-07T12:50:43.162585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.621243Z","title":"Bandits with preference feedback: A stackelberg game perspective","venue":null,"work_id":"8cb2dc32-3fc5-4dee-b588-41300b583ff1","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.268258Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:ce62d78c8e3b0156a0895a12c9937082c9539c98489bf0399651b68508d5d686","observation_id":"4f7d64a3-69ac-49b3-a6b5-ab2d59de08c1","resolution":{"observed_at":"2026-08-07T12:50:50.681901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:43.415191Z","title":"Scikit-learn: Machine learning in P ython","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.415191Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:95a557de3a9578cc2050bf16ec617f0a19b39045a5e09307115ee73ff0a242f8","observation_id":"caa9fe46-d605-42c5-bc2a-bcebf3c6eac5","resolution":{"observed_at":"2026-08-07T12:50:43.415191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.432786Z","title":"Optimal algorithms for stochastic contextual preference bandits","venue":null,"work_id":"a163cc17-85ea-4b30-8036-197b5743c83b","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.528257Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:d031feb406a47a39efec397f89938bf174cb5d3da9ced522ac447ae5d87e7ddd","observation_id":"166d52dd-32ae-4492-b81d-5df8ea1d1138","resolution":{"observed_at":"2026-08-07T12:50:50.504449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.300897Z","title":"and Krishnamurthy, A","venue":null,"work_id":"1de89bb2-19bb-483c-9e0b-6cca87f6fd46","year":2022},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.638184Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b9c18818c2c6eaf9332479f9da3964b8c63c3d69b80243045188874177111dae","observation_id":"7d52213e-1a68-489b-9e55-ee72fe4bb353","resolution":{"observed_at":"2026-08-07T12:50:50.376160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:50.147441Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":"1377c9c0-e822-4160-a788-0dee30720d9a","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.712472Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:a1cf87bfdc21962339d3b5b278343b737e93e0ecdfeae9c193e3a000ca5c993d","observation_id":"889bb251-af6e-403a-9647-950bd1ee4e92","resolution":{"observed_at":"2026-08-07T12:50:50.226512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.988179Z","title":"A domain-shrinking based bayesian optimization algorithm with order-optimal regret performance","venue":null,"work_id":"ab90587d-4e99-4db7-95cf-578d56899bc0","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.782700Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:bb11b1363f73843c2aa54f91cf2607df774295ed6647f2bfcf8709d17d2e4c52","observation_id":"1c144d77-19f3-46d8-b247-76c1035bb965","resolution":{"observed_at":"2026-08-07T12:50:50.071549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.811131Z","title":"Lower bounds on regret for noisy gaussian process bandit optimization","venue":null,"work_id":"4479792a-3709-4115-8cdc-eff2491adb64","year":2017},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.853547Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:e8881facbe68679b3b5462218fbfcfd202a1f8ada330ccb7ad82547a864efc2d","observation_id":"c2c9467f-1cca-4af2-bb75-07d3faab1062","resolution":{"observed_at":"2026-08-07T12:50:49.875455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.610659Z","title":null,"venue":null,"work_id":"e8d5cff6-2f57-406b-a128-6feb5f5c9b03","year":2001},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:43.935161Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:cd75b9f3846c12cb5e5c9eefe40e88a7a6d878a604939ce42981bb4b548e67ef","observation_id":"b123e8fe-ebfc-4bcf-940c-41a2afa6489c","resolution":{"observed_at":"2026-08-07T12:50:49.701942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:44.036902Z","title":"P., and De Freitas, N","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.036902Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:9234d725ebf93ba87bcb996d9c4b537087c880beb3394f4c338884a4a278a7b3","observation_id":"3758a7e0-2e92-465b-bbf7-cdeb81572b1c","resolution":{"observed_at":"2026-08-07T12:50:44.036902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.415754Z","title":"M., and Seeger, M","venue":null,"work_id":"3de27fbc-7ff1-427c-a1ab-93e56d8486c4","year":2010},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.117889Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:1782484d6953ae364da37aad415719cef2aa9526a218f061093cd21bd99e8f1b","observation_id":"23b44e2a-b881-4f5f-981d-8fbcc8ea02c5","resolution":{"observed_at":"2026-08-07T12:50:49.499940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.248796Z","title":"Towards practical preferential bayesian optimization with skew gaussian processes","venue":null,"work_id":"da998bf3-1905-48ea-a1eb-8bae783f9fb0","year":2023},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.202090Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:c5d6fe291460d7eb3b0747b9941e91ce23b1b5c02832d2b636350b423d1b552e","observation_id":"e8d65b47-20a1-4c62-9db7-57bebf343634","resolution":{"observed_at":"2026-08-07T12:50:49.311254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:49.068183Z","title":null,"venue":null,"work_id":"69fe6047-d993-4e7e-8f9f-644a83e9311e","year":1933},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.270455Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:dd38d71c0e50cb6fb8f1a22d678d4d38de6ea8db7c4dc8c822d1570b68e40b11","observation_id":"a985fd11-9b1a-4b58-a2eb-372ec3ca4b69","resolution":{"observed_at":"2026-08-07T12:50:49.159137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.924088Z","title":"Optimal order simple regret for gaussian process bandits","venue":null,"work_id":"be02596c-cc81-4758-875a-f369a03d7407","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.350553Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:160637f37f67f58096853c3520e661757c579e36a95a282f4f04ddb7521a969a","observation_id":"08434648-ed7d-40f3-bf5d-6b6810b15521","resolution":{"observed_at":"2026-08-07T12:50:48.991095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.797137Z","title":"On information gain and regret bounds in gaussian process bandits","venue":null,"work_id":"e8299b57-d76b-48fb-9d29-b8c96b848fde","year":2021},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.435530Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:64723d6014f027b6f5e9d9609b0ea644c97e0528f6c84b64040a2ed97ca2625a","observation_id":"b9381b72-7c92-4d46-9a8c-8c9188bc71d4","resolution":{"observed_at":"2026-08-07T12:50:48.847219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.605542Z","title":"Finite-time analysis of kernelised contextual bandits","venue":null,"work_id":"ed78e73e-42ed-4c6e-97f6-406cc39fa36f","year":2013},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.531719Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:1fd9f866c97f5130c70f1f8fdf8c107e078a0a0d0f6f26c32807650f6a59eb81","observation_id":"4d154dbc-42cf-4bea-8214-ebb4695eacbe","resolution":{"observed_at":"2026-08-07T12:50:48.739454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.395164Z","title":null,"venue":null,"work_id":"c79f1586-9d47-4018-8417-c40b8756431a","year":2025},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.601543Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:c7368003c838456afb9184b1a961cbf290dc52f3c1bfd7abe5540bbd4c1a9652","observation_id":"b91b39b6-17ce-4ffc-a485-0509836099e9","resolution":{"observed_at":"2026-08-07T12:50:48.477948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:44.680747Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.680747Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:466839ed40a770a8358844428ee8a7866844c66ae01d23ec6dd30b94035500fd","observation_id":"4fd5c7cf-d33e-4877-9957-135aea590e2a","resolution":{"observed_at":"2026-08-07T12:50:44.680747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:48.091759Z","title":null,"venue":null,"work_id":"17cc62b3-f975-4982-939b-f51e12dcb135","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.789087Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:3db0252902d2217433403b32906d742a2008edc2d85f7860713a14c7a9e58c7b","observation_id":"25dd1c45-fc65-4544-b0e1-c48f8c1ee64d","resolution":{"observed_at":"2026-08-07T12:50:48.210392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.848091Z","title":"and Sun, W","venue":null,"work_id":"bf1da5bf-c90d-455e-aaef-a68fb73e8d6d","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.884469Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:b34e74bbc130f7dcbaff564df9061aae054fb0db66704bf9bc1b09917fd0b66b","observation_id":"6e71dfec-1ae2-40e0-934d-9d0c8eee30b4","resolution":{"observed_at":"2026-08-07T12:50:47.955298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.568278Z","title":"Principled preferential bayesian optimization","venue":null,"work_id":"67617f50-6d7f-4544-b1ac-540588a688e4","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:44.981051Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:fc336e69f797ce17518295b8ae83dc6f603c21da41cb874bc701be6d0f29177a","observation_id":"92e305af-7512-4a3b-85d2-659758cb44ae","resolution":{"observed_at":"2026-08-07T12:50:47.700299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.336627Z","title":"Zeroth order non-convex optimization with dueling-choice bandits","venue":null,"work_id":"6cafb28a-3721-4ee6-9251-cdf8908205c2","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.103390Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:cc393d4b8b23e3d83399fef97b0c2e475069a1660217fb0c3d365dd7066ba25f","observation_id":"bb3d5c7e-ab48-4452-b719-d08bd5b063cb","resolution":{"observed_at":"2026-08-07T12:50:47.449181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:47.084273Z","title":"Preference-based reinforcement learning with finite-time guarantees","venue":null,"work_id":"0482bce6-2fb2-4feb-8648-54ffae306039","year":2020},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.192620Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:8696d504fb1b1abab04b11f3f3746cd04e2572a60735d605529d1cdf535d0238","observation_id":"f840f36d-5b10-4be3-8f71-ee7fb1ae6126","resolution":{"observed_at":"2026-08-07T12:50:47.176236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.825292Z","title":"and Joachims, T","venue":null,"work_id":"998b39d0-574d-4423-aaa0-29841e9c0f42","year":2009},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.253187Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:6640e04803bf4f4510ea5070af84e7c7b4766016f2fc48198652a4387fc0e740","observation_id":"9f09a41f-a9d6-47d5-91eb-6c09adb7e6d7","resolution":{"observed_at":"2026-08-07T12:50:46.923255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.556501Z","title":"The k-armed dueling bandits problem","venue":null,"work_id":"5576a44a-cc61-4fb5-b5d0-90ee4d51ee14","year":2012},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.318578Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:bf5a3f4e19df4b88a7c3f9eda8f20ca6e0b901459c49fa262f0e3dc46a9742f3","observation_id":"f90a452d-7f1b-4882-ade5-a0cca8fe9794","resolution":{"observed_at":"2026-08-07T12:50:46.669843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.282232Z","title":"D., and Sun, W","venue":null,"work_id":"e83a1915-43d3-4c6c-9d77-e31ad46c7cef","year":2024},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.418047Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:5a8a72414f0ca8b6ff083373accbbeda74344e0254489b62e7b9a80aa65dc12a","observation_id":"084eb858-f460-4be7-b7e6-405729726a10","resolution":{"observed_at":"2026-08-07T12:50:46.427524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:46.081066Z","title":"Relative upper confidence bound for the k-armed dueling bandit problem","venue":null,"work_id":"8217c219-9a00-4825-8916-07e2265411ca","year":2014},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.531566Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:99ad2759b68c8edb60bf77da8a0571d86f79ad23c8ada89ca845a6a55c15aed6","observation_id":"9d3dc523-5eee-4577-b38a-cb2a093b2b88","resolution":{"observed_at":"2026-08-07T12:50:46.179608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:45.872482Z","title":"Mergerucb: A method for large-scale online ranker evaluation","venue":null,"work_id":"e4d5f432-89c8-4e60-bca3-2c9cdfd5c956","year":2015},"citing_paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:45.634287Z"},"links":{"citing_paper":"/paper/2505.23673"},"observation_digest":"sha256:8626b32e22d09813f3fc58a1b9213647efdb7e6bbd49515e2fb1c5db24bd6602","observation_id":"243d5c50-0041-43b5-9901-9c4cb9c5cdb0","resolution":{"observed_at":"2026-08-07T12:50:45.950061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23673","last_updated":"2025-05-29T17:17:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:37:58.181685Z","submitted_at":"2025-05-29T17:17:29Z","title":"Bayesian Optimization from Human Feedback: Near-Optimal Regret Bounds"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.23673."}