{"as_of":"2026-08-08T11:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4717b1efee8c246b8b9ad6728ebe92256f7bea86ef7f574b5e45fbce0f17a04","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:20:13.158975Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:57:04.381612Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T19:57:04.556666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"cited_work":{"arxiv_id":"2502.10158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10158","snapshot_observed_at":"2026-08-07T19:57:04.556666Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","venue":"stat.ML","work_id":"b4f618f1-0124-4198-8cb1-1ba2ddfa8fa5","year":2025},"citing_paper":{"arxiv_id":"2502.10020","last_updated":"2025-06-16T13:10:36Z","snapshot_observed_at":"2026-08-07T19:38:26.119483Z","submitted_at":"2025-02-14T09:01:12Z","title":"Improved Online Confidence Bounds for Multinomial Logistic Bandits","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:57:04.381612Z"},"links":{"cited_paper":"/paper/2502.10158","citing_paper":"/paper/2502.10020"},"observation_digest":"sha256:250188b115c4345b2c470b63823842ccb40ca12e8dba958585fcf475fbf2d63f","observation_id":"43b8d225-c795-465e-b2a8-95d9a7baee25","resolution":{"observed_at":"2026-08-07T19:57:04.564210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10158/citation-record","integrity":"/paper/2502.10158/integrity","json":"/paper/2502.10158/citation-record.json","paper":"/paper/2502.10158"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.785181Z","title":"Instance-wise minimax-optimal algorithms for logistic bandits","venue":null,"work_id":"f8f98eba-dcc2-4d0a-860e-7f1e00a5cd05","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.224384Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:0f93e6738c16cb919250979f9bf95359a284d5a95528d2d6e7df258562c229ef","observation_id":"b18648c4-8d23-482a-b0d4-776f4aea6e69","resolution":{"observed_at":"2026-08-07T19:20:15.791208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.748016Z","title":"Vo q l: Towards optimal regret in model-free rl with nonlinear function approximation","venue":null,"work_id":"486dff9b-48ab-4ac2-b707-a064ed13ce73","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.231128Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:d64d51e715a44dacf7afaa049defdc86cdbbe769e915078979f6e372529c9377","observation_id":"28165428-c5d9-4984-b1fe-ef7bca76f6de","resolution":{"observed_at":"2026-08-07T19:20:15.761100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.724657Z","title":"A tractable online learning algorithm for the multinomial logit contextual bandit","venue":null,"work_id":"44918aa2-98d4-4e3d-b22f-5a886578b7c6","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.237577Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:504e40cdbee3a1bdc79a4c6514fa774a54bca180bafffa961c646256c7f86596","observation_id":"2f556e53-d9b4-478a-93e5-6bad9c169184","resolution":{"observed_at":"2026-08-07T19:20:15.731998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.699709Z","title":"and Goyal, N","venue":null,"work_id":"3fb32cea-6e8c-4ee5-a8e3-7915449a7169","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.245239Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:e420e65c2ceff3e38ca6026d6589c51b0841e6db6719a0b0f3a55f08551ecaa4","observation_id":"548ffc32-b4db-40e6-afa2-84473a54d7ee","resolution":{"observed_at":"2026-08-07T19:20:15.706758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.674423Z","title":"Thompson sampling for the mnl-bandit","venue":null,"work_id":"4bba03fa-255e-4e69-92d4-353d702cfa90","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.256779Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:b3440a755873664e1867f556bb7f21ae5405f419478aeb13c1aa244ecee80f73","observation_id":"c5559935-c99c-4704-94fc-f6e73a4e3652","resolution":{"observed_at":"2026-08-07T19:20:15.681536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.645792Z","title":"Mnl-bandit: A dynamic learning approach to assortment selection","venue":null,"work_id":"4479d1ab-4193-4ead-a71a-6cbb96cde221","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.262831Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:eedef0bfcbc280ea71a13d5ba08d546bd9f1aacb01ba9e753c4759899ee579a5","observation_id":"0080f2ad-5033-432b-92f4-b3169a7009ab","resolution":{"observed_at":"2026-08-07T19:20:15.657502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.271517Z","title":"April: Active preference learning-based reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.271517Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f5e7a98d2abbf2da84e02a2ee8ee5884e2f67d8472a575bcd24078855e076668","observation_id":"1a6b6990-e2f1-4953-b1bb-3f9504f68356","resolution":{"observed_at":"2026-08-07T19:20:12.271517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.605021Z","title":"and Thrampoulidis, C","venue":null,"work_id":"61e8b179-9198-46f0-b476-7316cb621955","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.284760Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:38e4dbb5be13375c00a39d9fc6c7a6b3e1c80b5016572248d4724c5d283daaf5","observation_id":"6ce715ec-61b0-468f-9f9a-9d88960490eb","resolution":{"observed_at":"2026-08-07T19:20:15.611297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.579227Z","title":"Distributional off-policy evaluation for slate recommendations","venue":null,"work_id":"3687d985-1b18-4758-9371-532f9c9d48c2","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.292863Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:937b5798df6b96ae03d03effaeed9af78be2595c7cc50c7cd08d12946acadb40","observation_id":"87e0a6b4-94a7-4b9e-af07-8a22e8837bc7","resolution":{"observed_at":"2026-08-07T19:20:15.587861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.552242Z","title":null,"venue":null,"work_id":"68fcb15d-f1ca-48e9-8a46-0a0cc2da66e6","year":2000},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.304989Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:65dab2dd9e1c82d8bcfdfb00449e1e5600def180bbd2753e2e5e5a97efdf9cb8","observation_id":"280622c9-3417-4960-854e-bad58b1406bd","resolution":{"observed_at":"2026-08-07T19:20:15.561019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.521773Z","title":"Combinatorial multi-armed bandit: General framework and applications","venue":null,"work_id":"62474f4b-3978-49d2-9e2b-dd01b262b6c1","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.312614Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:29c21efbb41379f75c972993e8ec026010948299d4f55c8ecd1e3a69c9757e9b","observation_id":"2ba47c7e-b279-4d54-8431-699597d2ea37","resolution":{"observed_at":"2026-08-07T19:20:15.532539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.501286Z","title":null,"venue":null,"work_id":"e6d22ade-2a7b-4b7d-90f3-e76618c927fb","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.323399Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:e4834a0964d11281a7a0e8fb7730a1fe4000e6f1844b2ec219d28ff20542f1bd","observation_id":"f373dd7e-7ebb-408d-b664-499d8c7959c3","resolution":{"observed_at":"2026-08-07T19:20:15.507919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.332237Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.332237Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:4e325aebde926c01c608ef80410fdd23bd6c1e216519915c4b630dedbe4dc61c","observation_id":"1301a24b-9616-49e4-be44-00e3b0eebef5","resolution":{"observed_at":"2026-08-07T19:20:12.332237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.434228Z","title":"S., Proutiere, A., et al","venue":null,"work_id":"da4cf61d-7fec-4871-9046-fa8809a80b12","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.341524Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:888c321bd5022a9b4df75c8fbbc3535c78e75f089787d177f94b59810c1e45d5","observation_id":"9f827c34-880e-4eb0-b828-1d6e72e67e0d","resolution":{"observed_at":"2026-08-07T19:20:15.443014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.397206Z","title":null,"venue":null,"work_id":"f2c6213e-9b9b-4aa8-ac36-1d82e033689a","year":1962},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.352173Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:6d7f28dd7331d2d15ecbbaff5369b72c9a78b24e6cca16c4dfd720cbcaa442a5","observation_id":"f486ebc0-5827-49a4-b03e-e77ade3febf1","resolution":{"observed_at":"2026-08-07T19:20:15.415420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.366805Z","title":"Assortment planning under the multinomial logit model with totally unimodular constraint structures","venue":null,"work_id":"66a747cc-1435-4b3b-b4f4-a3b165d8f1c9","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.359505Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:c9cbd3ac5bec02a23e21737486fbab74d0d86ec24a450715ec0015416f41de9e","observation_id":"6efd8f5d-8ecd-4f79-a205-07b39d9a6b00","resolution":{"observed_at":"2026-08-07T19:20:15.383925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.329535Z","title":"Reinforcement learning with combinatorial actions: An application to vehicle routing","venue":null,"work_id":"d725c2f8-bc53-4d8f-bc5e-f94331548142","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.365124Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f074b44a93077c105c62fccfd180417b5a7424663f2362e85641989d39f7968d","observation_id":"d28026fd-a4ba-4d6e-99d7-21851d4eb11f","resolution":{"observed_at":"2026-08-07T19:20:15.337692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.307973Z","title":"Bilinear classes: A structural framework for provable generalization in rl","venue":null,"work_id":"bd51e001-1428-40ef-97eb-efb1b85e101e","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.371484Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:98eae26e0af12ad6d85a0f660fdc11aa67c779a31f5171a736bb0c64e47362ad","observation_id":"dfac6861-d89d-44c1-9e18-c0cfc3117ede","resolution":{"observed_at":"2026-08-07T19:20:15.314252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08961","last_updated":"2024-04-07T05:29:24Z","snapshot_observed_at":"2026-08-02T19:45:37.530277Z","submitted_at":"2024-01-17T04:20:26Z","title":"Cascading Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2401.08961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08961","snapshot_observed_at":"2026-08-07T19:20:13.841407Z","title":"Cascading Reinforcement Learning","venue":"cs.LG","work_id":"a6b61ff3-ec33-401f-8ebc-ca144bacb1ad","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.377776Z"},"links":{"cited_paper":"/paper/2401.08961","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:d9d538b864c49146c571e6c7a1364d640caf79fb6f1483f2fa60595e7f7b2a75","observation_id":"ac33eec9-1542-41d9-aa9a-81687450b21a","resolution":{"observed_at":"2026-08-07T19:20:13.850736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.405443Z","title":"Improved optimistic algorithms for logistic bandits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.405443Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:2942560207a2ad393b8d0ed48ee785dd2d8c688fc9545f04019a8b391d6867db","observation_id":"cfa91a6f-ffe0-4abc-946c-00885a286f88","resolution":{"observed_at":"2026-08-07T19:20:12.405443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.259863Z","title":"Jointly efficient and optimal algorithms for logistic bandits","venue":null,"work_id":"cd0d5d71-a825-4db0-92fe-788f2dd0937d","year":2022},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.475614Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:09d94cbf3e2d0a1dac48de79e781b9e0c163e9d548dc25f0de1cecc49f2d56f6","observation_id":"098c220a-6abd-4050-b907-6c19d2a35cb0","resolution":{"observed_at":"2026-08-07T19:20:15.269061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.237249Z","title":"Parametric bandits: The generalized linear case","venue":null,"work_id":"3b912abe-7890-4b71-a627-41d8d9fe1dc6","year":2010},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.546882Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:bf1db5f69e80a51913c52825341d68ea45f2fe62a2623e990994ba3f8f973227","observation_id":"7e340fbd-91da-4e35-ba4b-b239c9866093","resolution":{"observed_at":"2026-08-07T19:20:15.243063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-07-06T12:22:32.240903Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-08-07T19:20:12.598167Z","title":"J., Kakade, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.598167Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:c4d870dd08e9bbf46054f02866b6859c83370ae12a8f3bd6a9a24187c11a3235","observation_id":"2f8a65c8-fb8b-4f3f-8849-0f9032f82e28","resolution":{"observed_at":"2026-08-07T19:20:12.598167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.212233Z","title":null,"venue":null,"work_id":"62ec14e4-7c21-4a75-b92c-549100bfd109","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.655974Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a19e99e37470e9a7cb1ee17d88b43f16d06282e4253c7ce41e90fa77aabb2384","observation_id":"c03b3cd5-d973-41bd-a51c-8dfa139917cd","resolution":{"observed_at":"2026-08-07T19:20:15.218068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03667","last_updated":"2016-09-17T00:52:43Z","snapshot_observed_at":"2026-07-06T04:59:39.409611Z","submitted_at":"2016-06-12T05:38:20Z","title":"Deep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads","version":4},"cited_work":{"arxiv_id":"1606.03667","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.03667","snapshot_observed_at":"2026-08-07T19:20:13.714767Z","title":"Deep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads","venue":"cs.CL","work_id":"25986f11-2183-4ad0-80b2-271c554d260f","year":2016},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.665758Z"},"links":{"cited_paper":"/paper/1606.03667","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:03c1f99cfe56b916f62088516606ea7024724964eb3fc6124cbfe3de79a702a9","observation_id":"6928cb0d-781e-413a-8e6e-441d96001d7d","resolution":{"observed_at":"2026-08-07T19:20:13.748595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.190093Z","title":"Slateq: A tractable decomposition for reinforcement learning with recommendation sets","venue":null,"work_id":"02d28674-7535-4e88-a532-758f764d8168","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.672769Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:e943d414abf4332fca206b81b28c9d8f966bdb8dc319a8a41d6556f9262e8e24","observation_id":"3d67be2f-445b-4ee9-8b72-fb62b692493b","resolution":{"observed_at":"2026-08-07T19:20:15.197624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.155608Z","title":"Randomized exploration in reinforcement learning with general value function approximation","venue":null,"work_id":"e4d66ac6-0cbc-47f3-b586-daa196d6c035","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.680375Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:d7cd30b6ba96c5fa9a96e4f5e17922579e58abbb19f34fcf0cb84ec66113cbd6","observation_id":"db054e73-4680-4d27-87cf-20070c8075d5","resolution":{"observed_at":"2026-08-07T19:20:15.166195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.125692Z","title":null,"venue":null,"work_id":"97286c1b-a3d3-49ec-8a1a-c44fbd81a016","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.685870Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:eb0ffe296af3961fd7c8784e856efa4d9eb242488f5ac1aee02d35261fe0f839","observation_id":"d37ac1b4-fda5-476f-a172-b224f7503961","resolution":{"observed_at":"2026-08-07T19:20:15.133885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.092102Z","title":null,"venue":null,"work_id":"ca01a623-f17a-45b4-b0c5-911323cb3e67","year":2018},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.692642Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:95e85b058f8f5971177b831dc22df485801325bdf7252db9fc296c335fbcd100","observation_id":"eb345469-8408-4da7-ab13-a4e73fec3f43","resolution":{"observed_at":"2026-08-07T19:20:15.102859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.070028Z","title":null,"venue":null,"work_id":"00993a8a-d2d3-4c69-8abb-ed9818166247","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.699888Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:adeca0c34a9d6ff9ccae9269572c746b9d086123cbdc30c3166099d5743e6848","observation_id":"768a359f-e859-454d-8b5d-64a5cc65c0f9","resolution":{"observed_at":"2026-08-07T19:20:15.076408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.045487Z","title":"Bellman eluder dimension: New rich classes of rl problems, and sample-efficient algorithms","venue":null,"work_id":"db430d82-cf20-4e9a-84b2-e81504932651","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.705775Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:e0ec5cdca619b548577db1cc98eaf0d83a7bd9c5f9d401e6a535a7b6e3c95f5b","observation_id":"20505fb5-e7b5-4bb6-bba8-f729ebe59dd9","resolution":{"observed_at":"2026-08-07T19:20:15.053824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07203","last_updated":"2023-04-18T12:57:43Z","snapshot_observed_at":"2026-07-06T11:18:53.721387Z","submitted_at":"2021-06-14T07:36:25Z","title":"Online Sub-Sampling for Reinforcement Learning with General Function Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07203","snapshot_observed_at":"2026-08-07T19:20:12.711779Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.711779Z"},"links":{"cited_paper":"/paper/2106.07203","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f495207e6bee756624a648f8a178e78d7566db82d1fe7c484ed9f7fd275357e1","observation_id":"c7559e90-d365-4d5d-887e-5c33a19d1edf","resolution":{"observed_at":"2026-08-07T19:20:12.711779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:15.008764Z","title":"Cascading bandits: Learning to rank in the cascade model","venue":null,"work_id":"170df7f6-453d-4ed9-b905-2742806e87dd","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.717594Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f3166ca32004e48af382009bde78a9c92e14b2ac260767a844542bb4aa31c563","observation_id":"e51f6d31-7122-487c-b078-3f5864f46902","resolution":{"observed_at":"2026-08-07T19:20:15.022919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.985146Z","title":"Combinatorial cascading bandits","venue":null,"work_id":"4b51a430-a379-4e1f-8b70-71b8328e737e","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.722642Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:099212f8a4cea5551f5cf86c978b46ea4f1160412084f14e39ee154e1a7122e0","observation_id":"97c5c92f-6b79-4add-a98d-4cb47ffe6888","resolution":{"observed_at":"2026-08-07T19:20:14.990933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.962901Z","title":"and Hutter, M","venue":null,"work_id":"522d6d6e-ac78-4c40-9a61-a6c7dd5e0b5c","year":2012},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.727018Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:fffe97f6b784a1343baa914824e2630971e459530c9231bbbb86f428afe6d325","observation_id":"a616e48a-f068-49d1-b623-93d9fbe07a2e","resolution":{"observed_at":"2026-08-07T19:20:14.969336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.940973Z","title":"and Oh, M.-h","venue":null,"work_id":"2ce13301-0976-410c-b387-6e958248c765","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.732283Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:19fb11dd5b5bd0b7eabee4b3fde7893c194ed6d68c93f5c76b7a5ebd7cf85c56","observation_id":"1d65c601-5eb0-47a9-a4f8-b27ae658b390","resolution":{"observed_at":"2026-08-07T19:20:14.946498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.914596Z","title":"and Oh, M.-h","venue":null,"work_id":"6acae787-1d16-495e-8054-eb58947a1f76","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.736731Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:97b4fd6e17863a6e1231a8abe102560bd54614e43f549c866ba529f81ee0ed0a","observation_id":"28b636af-c5f1-4f43-896a-d20548e80e13","resolution":{"observed_at":"2026-08-07T19:20:14.921457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.741426Z","title":"Online learning to rank with features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.741426Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:619e6042735db1f7e20fc0af3f8d2c7a12fb2e53c9be229d5941ec2eaa4c7b65","observation_id":"aabc5773-222e-482b-97a6-cc8434b97888","resolution":{"observed_at":"2026-08-07T19:20:12.741426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.860807Z","title":"Modelling the choice of residential location","venue":null,"work_id":"933e8d32-1bcc-497d-9cb8-fd415675ec68","year":1977},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.747449Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:095cb58fa172cb835072d481c8bac614616794d3277bc202eef0a3d2717276ac","observation_id":"2e7da764-f091-4cd8-8af8-a1b6b9e12d03","resolution":{"observed_at":"2026-08-07T19:20:14.869998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.839300Z","title":"Counterfactual evaluation of slate recommendations with sequential reward interactions","venue":null,"work_id":"5240ee1f-da63-44f7-a7e1-3bca8272274b","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.754104Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:6115d3ebed7390f615b878baf82371c3b2908488d965db2d9c0e5aa51abd955b","observation_id":"7ea4aeb3-84a7-439d-8dd2-8f0fb9d3985f","resolution":{"observed_at":"2026-08-07T19:20:14.846788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05035","last_updated":"2019-06-08T00:56:16Z","snapshot_observed_at":"2026-07-06T05:42:36.249572Z","submitted_at":"2017-05-14T22:53:13Z","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05035","snapshot_observed_at":"2026-08-07T19:20:12.761945Z","title":"Discrete sequential prediction of continuous actions for deep rl","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.761945Z"},"links":{"cited_paper":"/paper/1705.05035","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:59440b6839bc0cc6c8939ab0f61a0e8014ae986dbb8dcbf1d2cbcebcf00d78fd","observation_id":"fcfff1cd-f4ab-4158-ae4a-b06c3f79319c","resolution":{"observed_at":"2026-08-07T19:20:12.761945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.814637Z","title":"M., and Van Erven, T","venue":null,"work_id":"cfe5f21f-47d0-449b-977b-867b91e44116","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.792670Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a1f78e599398a2d7fdc041a07ed7c7cb4533d98ace9a2bc6528a156cd91dec22","observation_id":"f28ccee3-682d-4983-af4c-fc167647d0c5","resolution":{"observed_at":"2026-08-07T19:20:14.823133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.790913Z","title":"and Iyengar, G","venue":null,"work_id":"07ccc7c5-b7b2-471c-9a7d-5eda18a7d421","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.825505Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:8a8b8cb60bc8eec5aaa9eeacab2447ad0ab64b1acb8651b6ea72be9bce1e2f15","observation_id":"56c2cf88-add8-4503-afae-f42231ec6f72","resolution":{"observed_at":"2026-08-07T19:20:14.798459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.770403Z","title":"and Iyengar, G","venue":null,"work_id":"eb245a4d-c16d-4e1c-9f9d-183beb71bf70","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.844502Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:7b0d85991c90974b52a2fb2a2de8a88ddbae2bceca6eac78896070f14c6dfc1e","observation_id":"817c122c-11e5-4d5e-a8d0-f173f9c3e92f","resolution":{"observed_at":"2026-08-07T19:20:14.776371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-07-06T08:47:45.187408Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-07T19:20:12.870065Z","title":"A modern introduction to online learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.870065Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:8762ad75717672c84cdaa7e21bf11aeee9ff4e6fb5db0edd83d298cfc16fb1ed","observation_id":"5709ed03-ef9c-4ebf-8579-29b622ec9063","resolution":{"observed_at":"2026-08-07T19:20:12.870065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.896163Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.896163Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:fab6a1d277c424b07bc48fda49c9e74a1f631acf3b5ee84cd889d46abda33f55","observation_id":"71557d63-5f85-40df-aeba-389f1c2d1a42","resolution":{"observed_at":"2026-08-07T19:20:12.896163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.718056Z","title":"and Goyal, V","venue":null,"work_id":"68a769e2-3246-47ac-ad41-ed322b13ce95","year":2022},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.904201Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:b1a9e42b8cef5bc237cdd783ad198f36f65ae7ecbf5be38dfc6cc90299764f19","observation_id":"b44bb0a4-8212-49ba-821f-f13f5e3bc851","resolution":{"observed_at":"2026-08-07T19:20:14.725451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.695448Z","title":"M., and Shmoys, D","venue":null,"work_id":"08d9d978-2e77-430f-ae55-ca4bab984052","year":2010},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.910945Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:aa19c254475734b9100837b2d52b3e3df846943b54a08f66856b01b212e7c7ab","observation_id":"a975f62f-39bd-43ad-aa70-cfa62807d193","resolution":{"observed_at":"2026-08-07T19:20:14.702565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.639732Z","title":"and Van Roy, B","venue":null,"work_id":"118843e9-02de-4499-8542-df1b544b9fef","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.918859Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f84e8d4df6d44d8a3155fff2c4af76a15a9c2ad1ccae2c4e4b44467df65a3402","observation_id":"fd73fb0f-6618-47e3-8b24-2fa8b5fc3fcd","resolution":{"observed_at":"2026-08-07T19:20:14.674460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12397","last_updated":"2020-02-28T19:29:14Z","snapshot_observed_at":"2026-08-04T07:25:20.847892Z","submitted_at":"2019-09-26T21:16:17Z","title":"CAQL: Continuous Action Q-Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12397","snapshot_observed_at":"2026-08-07T19:20:12.926888Z","title":"Caql: Continuous action q-learning","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.926888Z"},"links":{"cited_paper":"/paper/1909.12397","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:0765100321ed1703d95f522fd7e85001b458f0f1a54c524c2ab3c4635967df0b","observation_id":"3b9cb725-dbc2-4f30-886e-b86fde07259b","resolution":{"observed_at":"2026-08-07T19:20:12.926888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.934451Z","title":"Dueling rl: Reinforcement learning with trajectory preferences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.934451Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:f74635bfb47cc86fe3b89422645035c67c1c5cc942e82077efb2dde03a9a2c88","observation_id":"c361c8e7-8103-4598-9c9c-54a000858ecd","resolution":{"observed_at":"2026-08-07T19:20:12.934451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.522121Z","title":"and Zeevi, A","venue":null,"work_id":"2474c291-067e-4381-8b92-e54f83ae26f7","year":2013},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.943188Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:42c853d1501b78577a1aa22a6ba2d9e514fbbe49b9344e92c64eaba8fc6f3dea","observation_id":"0f14d212-1104-4eb3-a749-0100b3ac460c","resolution":{"observed_at":"2026-08-07T19:20:14.571717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01124","last_updated":"2015-12-16T17:34:55Z","snapshot_observed_at":"2026-07-06T04:38:38.910342Z","submitted_at":"2015-12-03T15:51:30Z","title":"Deep Reinforcement Learning with Attention for Slate Markov Decision Processes with High-Dimensional States and Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01124","snapshot_observed_at":"2026-08-07T19:20:12.951927Z","title":"Deep reinforcement learning with attention for slate markov decision processes with high-dimensional states and actions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.951927Z"},"links":{"cited_paper":"/paper/1512.01124","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:60362a013ed5ebd667ebca8b25e2c9f805601e16f0781d3ba7c9718338b43983","observation_id":"e54c55dc-8a4a-4da0-b233-80cb91fa2068","resolution":{"observed_at":"2026-08-07T19:20:12.951927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.440291Z","title":"Off-policy evaluation for slate recommendation","venue":null,"work_id":"ffac5342-48e2-4279-9cc2-40ea72039666","year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.958603Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:9fe189704c561a7c3ae9f6ac2bc729ba160e1ad309108c80859468b7513ac9b7","observation_id":"2d6c0153-9fd0-48af-aeb0-753d3caa5d61","resolution":{"observed_at":"2026-08-07T19:20:14.490085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.385836Z","title":"Composite convex minimization involving self-concordant-like cost functions","venue":null,"work_id":"5b634974-57ba-4007-8094-6e4e7e897fa9","year":2015},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.967403Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:4b83b1a0f0a3218ff46ef4f2821a0d49888485eaf07759e29c9cdfde684ccefd","observation_id":"966e96de-4d75-4ed4-a76e-7b8f27233eb2","resolution":{"observed_at":"2026-08-07T19:20:14.392696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.363792Z","title":"Control variates for slate off-policy evaluation","venue":null,"work_id":"75bfcee1-eca5-4f9b-9223-a6981e2f7c36","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.973733Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:7d72f44472180732d0015563db3276d458fa0ba0d5064aa0a247029a8ee4ff55","observation_id":"0381e4e0-bdaa-41eb-8fd2-05ade2ab0bc1","resolution":{"observed_at":"2026-08-07T19:20:14.370807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.335470Z","title":"R., and Yang, L","venue":null,"work_id":"588c13d3-fc83-4589-b519-89c8b3f20276","year":2020},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.979355Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:8e6337fc2a6e8acb8edf5c04d65a4467ee8408d3c3f9b9067c83f3186a34a6d1","observation_id":"94a32340-6a5b-4085-bb4e-f7ca283eb595","resolution":{"observed_at":"2026-08-07T19:20:14.343071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.293523Z","title":"S., and Krishnamurthy, A","venue":null,"work_id":"5144f22c-f563-476a-82d1-9eb81aa6b9bc","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.984567Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:a71c5cc3412cca67139644f5b8ecab05649d017fa8fb2d19fc1c049432920938","observation_id":"cf765a08-75ae-4f55-8dba-ffcf813dc963","resolution":{"observed_at":"2026-08-07T19:20:14.299861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:12.992315Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.992315Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:2532db285a4dd088521dd871d99ab59e75493446f3cc0f13bc8b647be6ff14c9","observation_id":"f7cfa02b-79b3-4be3-9004-935ad45b2f17","resolution":{"observed_at":"2026-08-07T19:20:12.992315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.243590Z","title":"and Wang, M","venue":null,"work_id":"5f1cfcd4-15fb-4674-a51c-ba6b45269a74","year":2019},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:12.998266Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:b6e4e1b626f9c3a1282c14555a3d005b0f76e68bcbd538f67a38ac604dad927d","observation_id":"709c594c-281b-4b1f-b016-6bb1a69643b8","resolution":{"observed_at":"2026-08-07T19:20:14.250244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T19:20:13.002840Z","title":"D., and Sun, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.002840Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:9bfdb4abd31abb13df45ac36b625322ac6bbf9654fc3ea5b553dc645b7c3f6dd","observation_id":"ba8ba420-fd18-4f34-b324-9b965813f310","resolution":{"observed_at":"2026-08-07T19:20:13.002840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.218098Z","title":"and Sugiyama, M","venue":null,"work_id":"59802bf9-da3c-45d9-8da6-ec05192fa578","year":2024},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.009631Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:3a0d6ed4ffb10be6fec9a25a2de0ee4addc6d71fbefecf5216c856fc0096e9bc","observation_id":"304bad2e-afe8-4a0c-86ac-823bd00b71a0","resolution":{"observed_at":"2026-08-07T19:20:14.224992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:13.024732Z","title":"A nearly optimal and low-switching algorithm for reinforcement learning with general function approximation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.024732Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:d36faaad4525d88d03e82ed96d3224f59ff0e60dc43038dbe86b7c76df631794","observation_id":"b2ccb11c-209a-402c-ae20-0d9270cbc34b","resolution":{"observed_at":"2026-08-07T19:20:13.024732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.101687Z","title":"Nearly minimax optimal reinforcement learning for linear mixture markov decision processes","venue":null,"work_id":"a5841229-18c9-4425-bde2-44328f83c4f3","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.054874Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:280d169d179384019c8afba5137870258dbf3706baccea1af2283c0983e756a1","observation_id":"61a64b14-a5d7-4c2d-91d6-8eb528de124a","resolution":{"observed_at":"2026-08-07T19:20:14.158264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:14.000373Z","title":"Provably efficient reinforcement learning for discounted mdps with feature mapping","venue":null,"work_id":"e2607484-692e-4a66-bb86-1dce9804935f","year":2021},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.080977Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:2efaad2437591c719cf2c5020f858c8bca8d6a1857aedf384e9934f381278a8b","observation_id":"b708c4e8-4c11-4f98-97b7-749ec3e6d313","resolution":{"observed_at":"2026-08-07T19:20:14.048206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:13.883217Z","title":"Principled reinforcement learning with human feedback from pairwise or k-wise comparisons","venue":null,"work_id":"204581a5-e349-414e-a5cc-4279515b8f3f","year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.108373Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:1b2d40476aab657b380e793f2db9e612d647faff1a728a057c862e84e9f4a8a6","observation_id":"1d0be506-c88f-4589-a7c3-2ea55a333c73","resolution":{"observed_at":"2026-08-07T19:20:13.941327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:20:13.158975Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.158975Z"},"links":{"citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:847ea9df175fd6698017a9e9b4d5068f48d5b161d7519ac3cef2aea1a2080cef","observation_id":"f862ff19-2f46-4f8b-b608-2e8bc716e90a","resolution":{"observed_at":"2026-08-07T19:20:13.158975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","latest_version":3,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2502.10158."}