{"as_of":"2026-08-19T22:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:720940de75c3fb439c3470038de539add594d430bb0a4ed88184c27cdbf0988c","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:26:28.023566Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T11:34:19.258512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:36:13.482957Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"cited_work":{"arxiv_id":"2504.15812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15812","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fusing reward and dueling feedback in stochastic bandits","venue":null,"work_id":"84d992ca-9bad-4578-b3e9-0b738295c5fe","year":null},"citing_paper":{"arxiv_id":"2605.05745","last_updated":"2026-05-07T06:40:42Z","snapshot_observed_at":"2026-08-19T07:13:08.851486Z","submitted_at":"2026-05-07T06:40:42Z","title":"Best Arm Identification in Generalized Linear Bandits via Hybrid Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T11:34:19.258512Z"},"links":{"cited_paper":"/paper/2504.15812","citing_paper":"/paper/2605.05745"},"observation_digest":"sha256:5681dcb807bd8ac87427987fdb696f82ad1b411bff8c7f716dc276a8525aa455","observation_id":"1fbed955-ec04-4fc6-8faf-ca4e1ae5031d","resolution":{"observed_at":"2026-05-11T19:36:13.487443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15812/citation-record","integrity":"/paper/2504.15812/integrity","json":"/paper/2504.15812/citation-record.json","paper":"/paper/2504.15812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.912569Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.912569Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:07f4d80fb6ee0a8d05a6f3c5755355e1aeaeb48b4a1e1657847d0e68b1edc005","observation_id":"da95bc04-4358-408a-9646-d6b8a7a366cf","resolution":{"observed_at":"2026-08-16T11:26:27.912569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.916058Z","title":"Reducing dueling bandits to cardinal bandits","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.916058Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:2abc18e23df4cc0df22ff364d208e08e6a0be475a7a60d15d19a0e3b01d421b4","observation_id":"8641145e-155e-4d28-a5b4-56a996489663","resolution":{"observed_at":"2026-08-16T11:26:27.916058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.918940Z","title":"Using confidence bounds for exploitation-exploration trade-offs","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.918940Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:047494f1e3d230862084ac90288c4143c6921ec063f8b3efe4a21994beaa9ce9","observation_id":"abfb73c0-70b3-4592-9542-49308f27734f","resolution":{"observed_at":"2026-08-16T11:26:27.918940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.296335Z","title":"and Ortner, R","venue":null,"work_id":"34702c2a-99da-4cb1-95fe-7d6660fcbcdf","year":2010},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.923021Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:52a475f4fc45f2a567896d13167a866fe36fa3a4fd2f19549554debcae73d5fb","observation_id":"a9cb56b2-6511-4aa0-8461-d2b0c0f39069","resolution":{"observed_at":"2026-08-16T11:26:28.299414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.287639Z","title":null,"venue":null,"work_id":"718a8881-0ead-4b01-9159-51d53ab8ca28","year":2002},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.926123Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:ba6c1a43c698af8d999af5089ba3ecc909370622212c3274db1c8013593bda5f","observation_id":"e49611b4-babd-4f79-a02a-1a5cdd7bc54d","resolution":{"observed_at":"2026-08-16T11:26:28.290627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02703","last_updated":"2022-11-04T18:41:08Z","snapshot_observed_at":"2026-08-16T16:18:29.704979Z","submitted_at":"2022-11-04T18:41:08Z","title":"Online Learning and Bandits with Queried Hints","version":1},"cited_work":{"arxiv_id":"2211.02703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.02703","snapshot_observed_at":"2026-08-16T11:26:28.088013Z","title":"Online Learning and Bandits with Queried Hints","venue":"cs.DS","work_id":"16b45d62-db6c-419f-8804-e5a72581bf28","year":2022},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.929035Z"},"links":{"cited_paper":"/paper/2211.02703","citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:90dfd9668407a4780195a717983ee17374ab059cce5d91fdbe02555f413f7c4b","observation_id":"ec4067e4-2020-4531-9bd5-6526587055cd","resolution":{"observed_at":"2026-08-16T11:26:28.093365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.278731Z","title":"Bandits games and clustering foundations","venue":null,"work_id":"72b7d6d9-54dc-4be6-a761-4e9481ccccd8","year":2010},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.932434Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:ae9fc1d0e0951a387edcdb05eec1c1eca7c2baa3b420f3db8fad7e462ccd7d3c","observation_id":"95da1968-fc23-4f17-a86f-fb08a005ab0e","resolution":{"observed_at":"2026-08-16T11:26:28.281657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.270028Z","title":"Regret analysis of stochastic and nonstochastic multi-armed bandit problems","venue":null,"work_id":"d0f84707-1cf9-4d18-923c-8643cd91daaa","year":2012},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.935386Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:d3deadaab0de9b18f8bac7cb2aad605fab459db175b0650ad1818904a58733b9","observation_id":"9ea97d07-b67a-4b45-96a5-5795d56bebe8","resolution":{"observed_at":"2026-08-16T11:26:28.273168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.260983Z","title":"Kullback-leibler upper confidence bounds for optimal sequential allocation","venue":null,"work_id":"20c456f6-3c06-436d-bd78-9cf74aff1c5a","year":2013},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.938240Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:10e15b318b5402163d9ef59d2ae1b97f2c92a3c66766da6d2988e26b30c36482","observation_id":"1229c264-8c7a-4c4f-a734-8e226e4fe506","resolution":{"observed_at":"2026-08-16T11:26:28.264473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.941236Z","title":"Combinatorial multi-armed bandit: General framework and applications","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.941236Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:f10e2da54153b7fd46390ce75a51e4816d455b6f845b4145fac7be47e90d4d58","observation_id":"e28f4d59-b268-451e-8539-e332c1032733","resolution":{"observed_at":"2026-08-16T11:26:27.941236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.247121Z","title":"Leveraging initial hints for free in stochastic linear bandits","venue":null,"work_id":"6c4ca80e-fcd1-4579-86c5-992ae29df789","year":2022},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.944121Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:eb80ddf674f3561ed1140e1d0adf62f3dee4c363324a88c79c086dea724f7303","observation_id":"4778f404-d45c-4f15-9964-453f651d3f38","resolution":{"observed_at":"2026-08-16T11:26:28.250470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.947306Z","title":"and Takemura, A","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.947306Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:fdf82316d1b039d882691f1f07d2512631f4aa3e76e033fb7c9025f8b69fc69a","observation_id":"1744d793-f794-4568-8967-d4b05fe3a198","resolution":{"observed_at":"2026-08-16T11:26:27.947306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12975","last_updated":"2023-10-28T21:15:07Z","snapshot_observed_at":"2026-08-16T15:13:41.574673Z","submitted_at":"2023-07-24T17:50:24Z","title":"Provable Benefits of Policy Learning from Human Preferences in Contextual Bandit Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12975","snapshot_observed_at":"2026-08-16T11:26:27.949991Z","title":"Provable benefits of policy learning from human preferences in contextual bandit problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.949991Z"},"links":{"cited_paper":"/paper/2307.12975","citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:15b0d3b69a6617200dbe9647f868ada4e50e03428d1d78d7492effbefedb99b7","observation_id":"badb5ea3-3f00-44ec-a56a-facf1f0a8407","resolution":{"observed_at":"2026-08-16T11:26:27.949991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.232017Z","title":"Regret lower bound and optimal algorithm in dueling bandit problem","venue":null,"work_id":"ed7f0c56-1ef8-4622-bed1-7ca6959218a0","year":2015},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.953158Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:7bb374d433277627011dc2c3d9935d9376e465b31071ae6ff4767cc95230d4c3","observation_id":"b68548a0-716c-4ed6-a949-d7f44193029f","resolution":{"observed_at":"2026-08-16T11:26:28.235378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.955799Z","title":null,"venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.955799Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:0e1e680e15d6be3b3615b2f88cc3715cda7b355e26a795c565db136b6b4ebe67","observation_id":"8abb0548-3f25-491c-9aa6-3e8450b9550f","resolution":{"observed_at":"2026-08-16T11:26:27.955799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.958731Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.958731Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:a0388c8320e712bfacec3f6ea439e7a5a60470c8e2721027ac5632fd50cda43f","observation_id":"b5951fdd-7891-4fd5-a09a-36bb5d1b7f13","resolution":{"observed_at":"2026-08-16T11:26:27.958731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.961510Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.961510Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:b680b4077751c22900f332650984494449e391b5c4d872788d9e2221a647d946","observation_id":"1331cd2d-e465-49dc-8f34-75795c47aad8","resolution":{"observed_at":"2026-08-16T11:26:27.961510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02881","last_updated":"2024-06-20T16:11:59Z","snapshot_observed_at":"2026-08-18T12:00:15.205559Z","submitted_at":"2024-05-05T10:28:06Z","title":"FedConPE: Efficient Federated Conversational Bandits with Heterogeneous Clients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02881","snapshot_observed_at":"2026-08-16T11:26:27.964233Z","title":"Fedconpe: Efficient federated conversational bandits with heterogeneous clients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.964233Z"},"links":{"cited_paper":"/paper/2405.02881","citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:9d40274275f516668df1c078d51adb78fd18b7f41be141d6f34ac9001e377fb5","observation_id":"385e472a-2f51-4f3b-8361-4a202634539f","resolution":{"observed_at":"2026-08-16T11:26:27.964233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.206687Z","title":"Predictive bandits","venue":null,"work_id":"7c973c91-3808-4309-937c-c63072d585ff","year":2020},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.967344Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:f4b3f3990d40fe6c0dd1bad9750b9a1fb55e29fcf6ef117208f6aa6e0e9cdd8a","observation_id":"c4e6dd19-4977-4228-9fa2-4b70c6d31105","resolution":{"observed_at":"2026-08-16T11:26:28.209879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-08-15T05:32:55.984958Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-16T11:26:27.970502Z","title":"A modern introduction to online learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.970502Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:b18bb1a46318e70b58f66e02d086f95d3342393e15114a769c964b92dc4853ba","observation_id":"6c36c2ed-5cfe-4df9-8317-9a92750278ea","resolution":{"observed_at":"2026-08-16T11:26:27.970502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.974021Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.974021Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:4175492c57820d7b815eb23f4adcec2fc2f63a904a905725eafa336be9811a32","observation_id":"a8566238-90c5-4e1c-8d00-83b638a7f7d7","resolution":{"observed_at":"2026-08-16T11:26:27.974021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.976926Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.976926Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:001feaebb8c51e6ed1ea230e2477eb170e0a58d91652f1be3408d06f099ea2a9","observation_id":"a35474b1-5f3b-47b4-a798-54900651ec60","resolution":{"observed_at":"2026-08-16T11:26:27.976926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.187163Z","title":"and Gaillard, P","venue":null,"work_id":"8db3cce6-91b8-4ef3-b646-763538d4e8c9","year":2022},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.979839Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:b65d736bbafa362024851d06bb21353c3c3c4f52ad4dc5709f6722ae08fdf00a","observation_id":"27dae902-6484-4326-8333-a136e8eb860b","resolution":{"observed_at":"2026-08-16T11:26:28.190216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.179144Z","title":"Adversarial dueling bandits","venue":null,"work_id":"7b4ef037-2630-41e4-91ee-b68454d45ba1","year":2021},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.982972Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:4106ee4eacc145930f9f5464f415468b304a3855f55abe091c62f1881b1e30f7","observation_id":"df60c913-3808-40a8-bc17-823aeb6631f6","resolution":{"observed_at":"2026-08-16T11:26:28.181819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.985879Z","title":"Introduction to multi-armed bandits","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.985879Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:ea406a380904004f1998c88dfb9ec15bb5ba2c407193d884f0cac258809e26a9","observation_id":"cc7c96b8-eb21-4a36-aeff-7036b49e9a89","resolution":{"observed_at":"2026-08-16T11:26:27.985879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.170867Z","title":"Advancements in dueling bandits","venue":null,"work_id":"f820f7e5-f507-41b5-97ed-fd7c76b56621","year":2018},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.989861Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:08b204b7be5b841e097942311577b9e59144bafc8c477c031ca34895e915be8e","observation_id":"9efd110b-a94a-425a-9fab-213ee64c2fbc","resolution":{"observed_at":"2026-08-16T11:26:28.173745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.992859Z","title":"S., Barto, A","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.992859Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:4c66b7b031de5c80fc44426af9b72811f0eebc888be87e95e05f8fe35f2b75f1","observation_id":"cde7e502-452d-42db-b33a-a41576798b3e","resolution":{"observed_at":"2026-08-16T11:26:27.992859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:27.996006Z","title":"Algorithms for reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.996006Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:4a3c71aa26a24d364b8112b42256bd188ee9b7dd6e80aad79639d889eb1d41ff","observation_id":"d2af2e41-4d79-47fc-b6a8-91c1df46c467","resolution":{"observed_at":"2026-08-16T11:26:27.996006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.151971Z","title":"Generic exploration and k-armed voting bandits","venue":null,"work_id":"414be4f2-2e0d-47d9-9dd4-6cb0657549e8","year":2013},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:27.999561Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:3c0a5cbeb8d1de634392a0ba7b1abc6aff867c36e34ef23112219c293797d85f","observation_id":"f26268ef-941e-46ba-8bfb-5d0e3ed82d7d","resolution":{"observed_at":"2026-08-16T11:26:28.155100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14111","last_updated":"2023-11-03T18:36:03Z","snapshot_observed_at":"2026-08-19T12:08:13.307823Z","submitted_at":"2023-06-25T03:18:15Z","title":"Is RLHF More Difficult than Standard RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14111","snapshot_observed_at":"2026-08-16T11:26:28.002503Z","title":"Is rlhf more difficult than standard rl? arXiv preprint arXiv:2306.14111, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.002503Z"},"links":{"cited_paper":"/paper/2306.14111","citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:1d541024a77f5e7e70a2da9a27e879de44122b41116a42b623f1b45a37cdcd50","observation_id":"1889f57a-1754-46e2-aa64-b63558dcbddc","resolution":{"observed_at":"2026-08-16T11:26:28.002503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.143717Z","title":null,"venue":null,"work_id":"c37a7672-2e5c-4a8d-9e84-41f79d322cfb","year":2023},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.005792Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:2a492f1459bb6eb63a01fd3ec0c792a0fa035942f18be40146227ad2a9294e16","observation_id":"3e683b71-0839-4829-acaa-773fd1fcf329","resolution":{"observed_at":"2026-08-16T11:26:28.146612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.008906Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.008906Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:105893c6905bae4ddba367d38a7a4622147152e5b726ef08115d5a1c058f5e5d","observation_id":"66522df1-fb9f-41b7-a3d3-3b2240536954","resolution":{"observed_at":"2026-08-16T11:26:28.008906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.129393Z","title":"L., Craswell, N., Voorhees, E","venue":null,"work_id":"0fbe2a3e-c0b1-4a2a-9b59-9b08591d1920","year":2022},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.011819Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:ecc1ddb4c05274ede4e76c794651d271b44d8544e950a2e76584f4e13cf9a071","observation_id":"c0bc00a5-59cf-4316-a1c8-059998ba029d","resolution":{"observed_at":"2026-08-16T11:26:28.132593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.014581Z","title":"The k-armed dueling bandits problem","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.014581Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:371de9b6a7378e150274f53f22ec2febe35eee420e6ba781111e6fcdbdbb331b","observation_id":"ce8bcfb3-25fa-448f-b268-22d5b455dfb3","resolution":{"observed_at":"2026-08-16T11:26:28.014581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.115229Z","title":"Multi-armed bandit with additional observations","venue":null,"work_id":"abc87a22-0601-4787-a8a4-76cc31a73618","year":2018},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.017831Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:4b0bcca8cdd7f4cde2e6f7509be5842e7c883b74c5d9d0d57f98901cb8c656a8","observation_id":"17366d05-a6f8-4780-b2f5-76e1297ab72d","resolution":{"observed_at":"2026-08-16T11:26:28.118696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.106097Z","title":"Conversational contextual bandit: Algorithm and application","venue":null,"work_id":"ad945e94-0d81-4f7a-9f6a-6f07958b89ce","year":2020},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.020817Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:e5986d4ee79a4a16b93b30d6179f392417e867d295efad3071a943042f1c7ac5","observation_id":"a2ab13f3-d9ea-46ec-836b-532c87a6817a","resolution":{"observed_at":"2026-08-16T11:26:28.109362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:26:28.023566Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:26:28.023566Z"},"links":{"citing_paper":"/paper/2504.15812"},"observation_digest":"sha256:48bf939392105045c4917e137012fb84211edeadb01b7836d131554648495e80","observation_id":"65e54e4e-bbd2-48a7-b69f-fb172ddfef67","resolution":{"observed_at":"2026-08-16T11:26:28.023566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15812","last_updated":"2025-04-22T11:51:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T11:15:02.357997Z","submitted_at":"2025-04-22T11:51:20Z","title":"Fusing Reward and Dueling Feedback in Stochastic Bandits"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2504.15812."}