{"as_of":"2026-08-16T17:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b8f5cb076282b4284c2782b1475d305e234ffeb9b81887e9cf58bff87ff6db6","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:32:45.034109Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.07101/citation-record","integrity":"/paper/2505.07101/integrity","json":"/paper/2505.07101/citation-record.json","paper":"/paper/2505.07101"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.738291Z","title":"Blackwell approachability and no-regret learning are equivalent","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.738291Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:2086c8fa61d663467296ed798cbbd34d783515a95d891b97b4f59ed996877f2d","observation_id":"98f1e0d6-fd20-4c23-af26-15b0c7a4f71a","resolution":{"observed_at":"2026-08-15T22:32:44.738291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.742752Z","title":"Contextual bandit learning with predictable rewards","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.742752Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f1895e27f3271beb60a01415ca43486b3aacd3a647ef2f2b7b5ba3f7889baf14","observation_id":"5c9dc831-22c9-4888-9bb7-5fcf6f921f18","resolution":{"observed_at":"2026-08-15T22:32:44.742752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.746297Z","title":"Linear stochastic bandits under safety constraints","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.746297Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:2af4687a4425dba5f9f65349c2e10eb10a992c6c5d16c8a58ab00069b9ed2b01","observation_id":"1bb4de02-1f44-41b1-bf45-efeabdc0bc1b","resolution":{"observed_at":"2026-08-15T22:32:44.746297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.749742Z","title":"Safe reinforcement learning with linear function approximation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.749742Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:7b0abb51700e9cb8aa5a8b1b9e6650cf4034aacc2aa72451078d1eb25481ce3e","observation_id":"b3ce47e8-b783-4bc7-987f-a575842a834c","resolution":{"observed_at":"2026-08-15T22:32:44.749742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06239","last_updated":"2021-06-11T08:46:57Z","snapshot_observed_at":"2026-07-06T11:18:19.679530Z","submitted_at":"2021-06-11T08:46:57Z","title":"Safe Reinforcement Learning with Linear Function Approximation","version":1},"cited_work":{"arxiv_id":"2106.06239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06239","snapshot_observed_at":"2026-08-15T22:32:45.562353Z","title":"Safe Reinforcement Learning with Linear Function Approximation","venue":"cs.LG","work_id":"3df0cc16-8b2c-4b4b-8e50-8c8a5a500e35","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.753314Z"},"links":{"cited_paper":"/paper/2106.06239","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:20dd2a8093cc359abae92924cf6d4d80123bf34801c05846fd7ee2759d74745e","observation_id":"3db8b7a8-820e-4fd8-a22f-dfdc70d44e2b","resolution":{"observed_at":"2026-08-15T22:32:45.567226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14155","last_updated":"2025-01-24T00:46:52Z","snapshot_observed_at":"2026-08-16T17:02:13.017234Z","submitted_at":"2025-01-24T00:46:52Z","title":"Learning to Price with Resource Constraints: From Full Information to Machine-Learned Prices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14155","snapshot_observed_at":"2026-08-15T22:32:44.757169Z","title":"Learning to price with resource constraints: From full information to machine-learned prices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.757169Z"},"links":{"cited_paper":"/paper/2501.14155","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:556b5c2eac1ad0d5f95e2dc786b0ae990c816f0aea88903a28450cb265c44afd","observation_id":"8482aec3-96b5-4f83-b4ce-76fa201c1b35","resolution":{"observed_at":"2026-08-15T22:32:44.757169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03243","last_updated":"2021-06-06T20:44:23Z","snapshot_observed_at":"2026-08-16T10:50:22.943735Z","submitted_at":"2021-06-06T20:44:23Z","title":"Neural Active Learning with Performance Guarantees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03243","snapshot_observed_at":"2026-08-15T22:32:44.761074Z","title":"Neural active learning with performance guarantees, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.761074Z"},"links":{"cited_paper":"/paper/2106.03243","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:6ce03e993c7073ce9d8dac6275c49875e0f750fee5815dd0c36da575f5583cda","observation_id":"2484bc50-7716-4a63-b050-9fd6ce88608e","resolution":{"observed_at":"2026-08-15T22:32:44.761074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:46.052580Z","title":"An active learning framework for multi-group mean estimation","venue":null,"work_id":"d9883f20-2e90-413f-98b6-bebdb5c9abf9","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.764963Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:e96e39fb2a1d1c54b51fc638af5b861048d74938897e7d5e129aa5003e95d069","observation_id":"af0dd7c3-b7ba-411b-8798-e9613b1b57b4","resolution":{"observed_at":"2026-08-15T22:32:46.057068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.768249Z","title":"Bandits with knapsacks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.768249Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:b1c4aa046470147fc64023bc4753c2159790a922ef6f413442a7bd6404c787dd","observation_id":"00d09d0a-655d-4471-95ae-6640c147e1ed","resolution":{"observed_at":"2026-08-15T22:32:44.768249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:46.032079Z","title":"Using contextual bandits with behavioral constraints for constrained online movie recommendation","venue":null,"work_id":"3ce941ba-3fe6-494a-8231-d7790dee0cf3","year":2018},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.771735Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:05a84c02d48a192717e6ea5bc4489be4d6addf61da48fac928b260491abbf125","observation_id":"6da757c5-6e38-47f4-a23e-c704138f1d95","resolution":{"observed_at":"2026-08-15T22:32:46.037176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00423","last_updated":"2023-01-16T16:14:27Z","snapshot_observed_at":"2026-08-16T16:27:34.288678Z","submitted_at":"2022-10-02T05:03:38Z","title":"Improved Algorithms for Neural Active Learning","version":3},"cited_work":{"arxiv_id":"2210.00423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.00423","snapshot_observed_at":"2026-08-15T22:32:45.525093Z","title":"Improved Algorithms for Neural Active Learning","venue":"cs.LG","work_id":"ba078aa1-567b-43dc-a976-11f42093b2f6","year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.774866Z"},"links":{"cited_paper":"/paper/2210.00423","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:81f54e4549d0c0814dc9c4450ff0fc5c9f942d57e7760752602194a2cde36801","observation_id":"b7b6674d-6343-4183-8cb3-f5f29dcbd13c","resolution":{"observed_at":"2026-08-15T22:32:45.528875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:46.020143Z","title":"Neural contextual bandits for personalized recommendation","venue":null,"work_id":"4001d7cd-297b-45b6-bc9c-c3bd04b1e085","year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.778471Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:132eebf0dac180d97d78e380b03856ad628904afaf15c34106c230cfa2dac7b5","observation_id":"7c4e7cc1-832e-42cb-9322-02a689c46283","resolution":{"observed_at":"2026-08-15T22:32:46.024566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:46.008167Z","title":"Sequential experimentation in clinical trials: design and analysis, volume 298","venue":null,"work_id":"eddc4e6e-3ecd-4470-89dd-d3dd8d2fe4f9","year":2012},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.781766Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:da9baff8e9aa91c9829ae4180edaf48322ba691b08b43155e62432d0153662f2","observation_id":"59bc9089-2ec4-484b-ac43-5c77433ad2f0","resolution":{"observed_at":"2026-08-15T22:32:46.012184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.997469Z","title":"Online decision making with high-dimensional covariates","venue":null,"work_id":"0533b7e9-104c-48f4-99f9-2111fa5a3b83","year":2020},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.785024Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:14730acec29008ccccc62251215d2cc1f3c4718061ef6786b2453a71af84018a","observation_id":"e7131ce5-a4a0-4e1c-9fd8-6a42f8a5a76f","resolution":{"observed_at":"2026-08-15T22:32:46.000982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01067","last_updated":"2022-06-02T14:33:00Z","snapshot_observed_at":"2026-08-16T16:55:44.502966Z","submitted_at":"2022-06-02T14:33:00Z","title":"Practical Adversarial Multivalid Conformal Prediction","version":1},"cited_work":{"arxiv_id":"2206.01067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.01067","snapshot_observed_at":"2026-08-15T22:32:45.510774Z","title":"Practical Adversarial Multivalid Conformal Prediction","venue":"cs.LG","work_id":"c4ef7523-68fd-4f24-859f-cc09055a1706","year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.788316Z"},"links":{"cited_paper":"/paper/2206.01067","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:43029096d924bd828de4d98aa6078a552812ae99b22d0a59cbf9a5e5d97a97c7","observation_id":"4b0e9886-86cc-4ae3-84b4-1c09e71c7ee3","resolution":{"observed_at":"2026-08-15T22:32:45.514630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.985424Z","title":"A unifying framework for online optimization with long-term constraints","venue":null,"work_id":"b7860eb2-706f-49b4-82c8-0f610b54e5d2","year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.791701Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:c6c4a5e8ffdefe2480ce80d8996bb9f2d7f89a699157e8c4eaf70644f97297f9","observation_id":"4c2aefa9-a2d0-465d-bd68-4446e74e577f","resolution":{"observed_at":"2026-08-15T22:32:45.989703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.972830Z","title":"Safe reinforcement learning for multi-energy management systems with known constraint functions","venue":null,"work_id":"bd835d10-518e-4838-8504-846387f26276","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.795026Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:9979c8d05068862d662ece2086417dbc2974b8de249c02e92ba4c575c8ff9394","observation_id":"22fdc812-d321-4a19-8bff-2e7213243394","resolution":{"observed_at":"2026-08-15T22:32:45.977815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12176","last_updated":"2023-11-20T20:43:49Z","snapshot_observed_at":"2026-08-16T14:41:42.478870Z","submitted_at":"2023-11-20T20:43:49Z","title":"Covert Online Decision Making: From Sequential Hypothesis Testing to Stochastic Bandits","version":1},"cited_work":{"arxiv_id":"2311.12176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12176","snapshot_observed_at":"2026-08-15T22:32:45.495953Z","title":"Covert Online Decision Making: From Sequential Hypothesis Testing to Stochastic Bandits","venue":"cs.IT","work_id":"34e80cc3-2b34-4623-8f52-1547a5e70f62","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.799212Z"},"links":{"cited_paper":"/paper/2311.12176","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:c9f1a6da8b3888766a811b69f454ba828f734781cfed24a90b3eb686d210ae6e","observation_id":"0c35edc6-3b92-4a45-af88-ee17c5ff6178","resolution":{"observed_at":"2026-08-15T22:32:45.500176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1999.0719","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.476989Z","title":"A proof of calibration via blackwell's approachability theorem","venue":null,"work_id":"a1c83639-84b6-424f-aa41-266dfec8a86c","year":1999},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.802844Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:3ff528c3349a094929e3a2130889b5dbe66047509a1c3dfa166cff4ed7db83fe","observation_id":"fdb206f6-a9e1-4947-b14f-9db94c906157","resolution":{"observed_at":"2026-08-15T22:32:45.484406Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.806027Z","title":"Asymptotic calibration","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.806027Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:e7a487900f8852592a693c2fae9fbe34f3e0755a55739c8a26fb41d4bbc524f7","observation_id":"646dd5f2-7b49-40a3-8a94-e2021f509d2c","resolution":{"observed_at":"2026-08-15T22:32:44.806027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.809213Z","title":"Beyond ucb: Optimal and efficient contextual bandits with regression oracles","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.809213Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:21b0db16da24908196f0eb1aa70efb4ccfeb877bbc3533e8b15157106e1a3c67","observation_id":"32901203-6df7-4083-a773-448ff5ada438","resolution":{"observed_at":"2026-08-15T22:32:44.809213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-08-13T17:08:25.517069Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-08-15T22:32:44.812516Z","title":"The statistical complexity of interactive decision making","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.812516Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:ae30e7e1f41e86a5dc056392ba7e2784dc224da9688f5fd3ada45a93e36be3df","observation_id":"9abc67e2-6963-4ced-83b5-2c0d97a18c88","resolution":{"observed_at":"2026-08-15T22:32:44.812516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.951469Z","title":"Matrix theory","venue":null,"work_id":"d1b7d567-e549-49e1-828f-04561fc9d16d","year":2012},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.816691Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f0d17b20cd31db3cfbe3d913c4a8c30a4fb97166bc073101c48c6c273748a391","observation_id":"1af5543d-9b30-477d-87a3-39f1c55fda78","resolution":{"observed_at":"2026-08-15T22:32:45.954796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.941663Z","title":"Exploration vs exploitation vs safety: Risk-aware multi-armed bandits","venue":null,"work_id":"1c1dcc61-7fc0-4345-ac3e-fd4b02bdfe48","year":2013},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.819978Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:6f1db42e10bbfcecfe5698ca98d1170b68d888c4840e9f510138c76b2611778e","observation_id":"9e028116-e8c9-40ad-b5f6-3a7b75674a3a","resolution":{"observed_at":"2026-08-15T22:32:45.945215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.931648Z","title":"Regret-optimal measurement-feedback control","venue":null,"work_id":"577a3ea3-ff36-4f2a-ab5b-fcaec3cf3f35","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.823357Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:7becb6e86043cef8069b15efbdd0a07049b1968e3d84f97de41af96fda4cca15","observation_id":"02c5e0cb-57b9-463b-8161-a04c2981d855","resolution":{"observed_at":"2026-08-15T22:32:45.935137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12097","last_updated":"2021-06-22T23:14:21Z","snapshot_observed_at":"2026-08-13T18:58:53.743774Z","submitted_at":"2021-06-22T23:14:21Z","title":"Regret-optimal Estimation and Control","version":1},"cited_work":{"arxiv_id":"2106.12097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.12097","snapshot_observed_at":"2026-08-15T22:32:45.405952Z","title":"Regret-optimal Estimation and Control","venue":"cs.LG","work_id":"2801e7f5-075f-481a-9912-78c0370d1338","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.826974Z"},"links":{"cited_paper":"/paper/2106.12097","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f652c8818ddf9a234f8df37f7da01f412ce52d6a7bdb1f2ab4e9c075f8bec644","observation_id":"cbf2e62d-3f40-4f3b-b521-ebab43d580c0","resolution":{"observed_at":"2026-08-15T22:32:45.410117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05389","last_updated":"2021-09-11T23:28:49Z","snapshot_observed_at":"2026-08-13T18:13:28.124139Z","submitted_at":"2021-09-11T23:28:49Z","title":"Omnipredictors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05389","snapshot_observed_at":"2026-08-15T22:32:44.830400Z","title":"Omnipredictors, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.830400Z"},"links":{"cited_paper":"/paper/2109.05389","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:20ea479466649f4c8f24b01cbf4a73c474a6a2ce927ed2c86f742cf8a1fa4937","observation_id":"f0a4e8fe-56d6-4e0e-a969-9d063dc5772c","resolution":{"observed_at":"2026-08-15T22:32:44.830400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.920405Z","title":"Maximum approximated likelihood estimation, 2019","venue":null,"work_id":"422133f0-f8a8-4508-a24a-2f575d66d114","year":2019},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.834802Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:ff0269aa05de8a7f1d691c3d8778dd7e762956bc2304cc423a0205b0ad681942","observation_id":"86ca4c46-5ef9-4934-b735-7be4c302154e","resolution":{"observed_at":"2026-08-15T22:32:45.923773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-16T16:58:50.532049Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-15T22:32:44.838063Z","title":"A review of safe reinforcement learning: Methods, theory and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.838063Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:7b9faac2608a3936b87e7c4587bcf556364d50793ddc697adf0bd45506b5dada","observation_id":"bd15390d-51b0-475d-8342-99d9ddeb0fd8","resolution":{"observed_at":"2026-08-15T22:32:44.838063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.910514Z","title":"The star number and eluder dimension: Elementary observations about the dimensions of disagreement","venue":null,"work_id":"a8793ca3-c385-4f6f-ac57-418679cd8cbd","year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.841651Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:108d056da8d0a01ccb29aaf3d8d60bcba70af9e3cb78d6181f6e6aad19535dd4","observation_id":"21ea1a11-b538-4a8e-a5bd-e22cc79e0100","resolution":{"observed_at":"2026-08-15T22:32:45.914194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.900306Z","title":"Learning with safety constraints: Sample complexity of reinforcement learning for constrained mdps","venue":null,"work_id":"aa5661e6-cc6a-425f-9251-485fb5d04d5f","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.845964Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:eddc2ee36b4a2a9378c8e701ef6dbeb8400e09488a7a252baadfefa2e95e6d11","observation_id":"6836ed3f-cc80-4f6e-9d41-892058b1c477","resolution":{"observed_at":"2026-08-15T22:32:45.904233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.889097Z","title":"The nonstochastic control problem","venue":null,"work_id":"491cf1ba-dee6-4b00-9c39-e4c89ccdbf76","year":2020},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.850156Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:6f63033eb76972765d4bc832ac6e895359ac0f7d80b3b684b40d86779578d18b","observation_id":"8556ade6-5eb6-4d7f-a05f-7def6ebdc2bc","resolution":{"observed_at":"2026-08-15T22:32:45.893375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18359","last_updated":"2025-01-30T14:05:20Z","snapshot_observed_at":"2026-08-13T08:04:49.405919Z","submitted_at":"2025-01-30T14:05:20Z","title":"Contextual Online Decision Making with Infinite-Dimensional Functional Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18359","snapshot_observed_at":"2026-08-15T22:32:44.853388Z","title":"Contextual online decision making with infinite-dimensional functional regression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.853388Z"},"links":{"cited_paper":"/paper/2501.18359","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:a7f42a8354390409df75d18e5532141b7b3e385ef2f0c931fdafcc1e24a81b54","observation_id":"960cf1f7-95eb-4f5a-a836-13df816d0bdc","resolution":{"observed_at":"2026-08-15T22:32:44.853388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15006","last_updated":"2024-03-11T23:32:33Z","snapshot_observed_at":"2026-08-16T15:05:04.531023Z","submitted_at":"2023-08-29T03:54:53Z","title":"Directional Optimism for Safe Linear Bandits","version":2},"cited_work":{"arxiv_id":"2308.15006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.15006","snapshot_observed_at":"2026-08-15T22:32:45.364170Z","title":"Directional Optimism for Safe Linear Bandits","venue":"cs.LG","work_id":"a5e76845-71e2-4f1c-aaa0-144be5085eb2","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.857181Z"},"links":{"cited_paper":"/paper/2308.15006","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:14eccfc5af5fd6b334df452d0f35ab62050abb2f84fe5ad82afc6c8298d874f9","observation_id":"12d44519-732e-46b8-a03d-1a2520803d06","resolution":{"observed_at":"2026-08-15T22:32:45.368131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.878180Z","title":"Safe exploration for optimizing contextual bandits","venue":null,"work_id":"c4e740ec-0e64-4e72-be0b-c47a970f9e6a","year":2020},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.860839Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f03f5b32b0eb4f767d7c247bfb553bddfec2d85ac6feba3211ffa0e7d0b31a37","observation_id":"277b8649-d9dd-4471-9f66-5cdf68dac85d","resolution":{"observed_at":"2026-08-15T22:32:45.882000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.867220Z","title":"Online learning for equilibrium pricing in markets under incomplete information","venue":null,"work_id":"1057918e-907a-41f9-a04a-da34cf7e642e","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.864164Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:2d2961205920631b89068f6fead0a7dde0cc68f9c21e94c64309cfda1f6d4ae2","observation_id":"b588c642-fea0-4501-b9ca-40ff25a3ff2b","resolution":{"observed_at":"2026-08-15T22:32:45.870637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.856649Z","title":"Group sequential methods with applications to clinical trials","venue":null,"work_id":"18e1b998-2934-4e06-9138-4e191507daae","year":1999},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.867519Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:203ff87c3fb15cef1baf034a0ce1d36cedaf254c718d84c34de61c8ed3cd5bb9","observation_id":"fca7cb71-4474-4e4d-a583-562a2b057f7e","resolution":{"observed_at":"2026-08-15T22:32:45.860291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.845755Z","title":"How does variance shape the regret in contextual bandits? Advances in Neural Information Processing Systems, 37: 0 83730--83785, 2024","venue":null,"work_id":"2a40349e-0e97-4a1e-ab3c-44f0f80bb81b","year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.870834Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:7a4fb7ea680d466f21e81688e51f051c69df717b835cb0b737879037a60db373","observation_id":"3031db3b-cb51-41f8-bf21-cb49b328b19e","resolution":{"observed_at":"2026-08-15T22:32:45.849888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12013","last_updated":"2022-09-24T14:02:05Z","snapshot_observed_at":"2026-08-16T16:30:10.082115Z","submitted_at":"2022-09-24T14:02:05Z","title":"Non-monotonic Resource Utilization in the Bandits with Knapsacks Problem","version":1},"cited_work":{"arxiv_id":"2209.12013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.12013","snapshot_observed_at":"2026-08-15T22:32:45.349957Z","title":"Non-monotonic Resource Utilization in the Bandits with Knapsacks Problem","venue":"cs.LG","work_id":"6346bed8-2544-4c60-abed-0b0557281257","year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.874168Z"},"links":{"cited_paper":"/paper/2209.12013","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:c2c633187deff3062a7374f07a6070c7ebdf1f262fe2a5bbe009402886fcde86","observation_id":"75e0499e-7b41-40f1-9b07-6621cedb5dca","resolution":{"observed_at":"2026-08-15T22:32:45.353913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.834820Z","title":"Heterogeneous sequential hypothesis testing with active source selection under budget constraints","venue":null,"work_id":"87a81e48-24d2-48af-a44e-2cc598f11d65","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.878294Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:a7ba0d099f63702d25281d740bc85e085496d6cbbc52ea7130f85774889c9fa4","observation_id":"f2ca400b-6a54-40d7-adb7-7b55b0bd8a78","resolution":{"observed_at":"2026-08-15T22:32:45.838878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.823811Z","title":"Eluder-based regret for stochastic contextual MDP s","venue":null,"work_id":"ffdcb4e3-1184-43d1-9eca-61b93b7acc3c","year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.881716Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:8c1e768cdb54be9137f4100c8b195bcecf9af87c4544d206ee12f91496dbb196","observation_id":"28c4c814-5533-4897-a314-350223551f45","resolution":{"observed_at":"2026-08-15T22:32:45.828028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.885327Z","title":"Understanding the eluder dimension","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.885327Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:fe1f91dc04085dc71f144f4ca590a1bd4c532008dbf2ab6783ebc8465464693f","observation_id":"95596c2c-8a52-46ae-93b1-be3d310c5a5d","resolution":{"observed_at":"2026-08-15T22:32:44.885327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.888870Z","title":"A contextual-bandit approach to personalized news article recommendation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.888870Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:ab70c529f314961397ac2ad0a7631472096e9adbb02306962b8c7ec2fb936de8","observation_id":"10fafdcc-1d2e-4797-84ee-b7317c235a17","resolution":{"observed_at":"2026-08-15T22:32:44.888870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.800663Z","title":"Online optimal control with linear dynamics and predictions: Algorithms and regret analysis","venue":null,"work_id":"1f9bd40a-a9d7-4ceb-9962-764a45f2b580","year":2019},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.892184Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:21f88acb179e2905022e1fcf65d3afc1eea83f714929798381e79c99a557f676","observation_id":"0f247b78-9f7a-4f3d-a84f-e9df1236d4fe","resolution":{"observed_at":"2026-08-15T22:32:45.804584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15036","last_updated":"2024-11-22T16:08:42Z","snapshot_observed_at":"2026-08-14T10:43:17.045226Z","submitted_at":"2024-11-22T16:08:42Z","title":"Safe Multi-Agent Reinforcement Learning with Convergence to Generalized Nash Equilibrium","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15036","snapshot_observed_at":"2026-08-15T22:32:44.895422Z","title":"Safe multi-agent reinforcement learning with convergence to generalized nash equilibrium","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.895422Z"},"links":{"cited_paper":"/paper/2411.15036","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:49a2018fafb87edc16da0a6e35c0d1e49044e81dcce8e087069cc91d30379e3a","observation_id":"49100940-86d6-4858-9859-67955cc2325a","resolution":{"observed_at":"2026-08-15T22:32:44.895422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.898897Z","title":"Cautious regret minimization: Online optimization with long-term budget constraints","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.898897Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:4c1322869f15ec53da1ce22f4dcc8e605787d6a25626fec036fa66a4af6c8a7b","observation_id":"4c3c155e-a057-4f5c-8e8f-91e6c629148f","resolution":{"observed_at":"2026-08-15T22:32:44.898897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.902240Z","title":"Trading regret for efficiency: online convex optimization with long term constraints","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.902240Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:0d47b0a4086e05e18153a2c9834a54d182b143717c7bbeeaeb885fa104e00b35","observation_id":"f49e1baf-cfb2-406e-b7d9-6a6acbf9c544","resolution":{"observed_at":"2026-08-15T22:32:44.902240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.778316Z","title":"Sequential multiple hypothesis testing with type i error control","venue":null,"work_id":"85c8c47a-935b-4f1d-abfa-2c48c362e0cf","year":2017},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.905524Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:d420446f27d8b7666e8bf9c47df2be756d6e7f39367abab08f1dbec872ec487a","observation_id":"c1b68d74-1bfb-45cc-b824-fefa872a40c8","resolution":{"observed_at":"2026-08-15T22:32:45.781719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.768107Z","title":"Online learning with sample path constraints","venue":null,"work_id":"e03ffecc-4430-4e34-8524-ff14ebab30a3","year":2009},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.909132Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:747586976ee7ffe8ee9a596857f31f4fed6d3ba6198e80e202bbe57f7316c4b6","observation_id":"a5d9d784-1066-4f82-b3ff-1277ec78f8c7","resolution":{"observed_at":"2026-08-15T22:32:45.771485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.758001Z","title":"Safe control with minimal regret","venue":null,"work_id":"f947bc6a-93e9-4dcf-9635-54b85c8fde3a","year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.912818Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:978b603f680f1cfa6eefbcb8adc11fbb20caac5a820422a47a371b18ff493a42","observation_id":"8b61a096-26dc-4b4c-a765-ed92ba75d6e7","resolution":{"observed_at":"2026-08-15T22:32:45.761396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14835","last_updated":"2024-07-03T09:19:55Z","snapshot_observed_at":"2026-08-16T15:36:58.426960Z","submitted_at":"2023-04-28T13:21:46Z","title":"Regret Optimal Control for Uncertain Stochastic Systems","version":3},"cited_work":{"arxiv_id":"2304.14835","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.14835","snapshot_observed_at":"2026-08-15T22:32:45.325882Z","title":"Regret Optimal Control for Uncertain Stochastic Systems","venue":"eess.SY","work_id":"39d00a8e-bd83-4ce8-93af-dd996b59000e","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.916356Z"},"links":{"cited_paper":"/paper/2304.14835","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:3f0c493557ddde662666f884dda519a43e26a9bb806d90617c478e0ab1d51934","observation_id":"313be06a-f894-415f-9262-2d6c5888b817","resolution":{"observed_at":"2026-08-15T22:32:45.329631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.919885Z","title":"Hard-constrained neural networks with universal approximation guarantees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.919885Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:7f1b5137b63e5a4c5986482013cbcbfd154f925a4ca3c00cece08d4c8752c15b","observation_id":"6abc4fcf-fd4e-4559-9703-15a9ff067a1c","resolution":{"observed_at":"2026-08-15T22:32:44.919885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.747268Z","title":"Reinforcement learning with convex constraints","venue":null,"work_id":"53ce0ee5-e441-40eb-a168-63f04ab47a03","year":2019},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.923178Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:4d4e59470cfd9f5e72f716240b3471d0f01ef9c2dcba98070d0ecaca539028df","observation_id":"f428e878-369c-40ff-ab5d-2c4ee520241a","resolution":{"observed_at":"2026-08-15T22:32:45.751307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.736945Z","title":"Safe linear thompson sampling with side information","venue":null,"work_id":"36457e54-93bf-4663-8e78-65e6b4c431bc","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.926532Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:16b45d27f059916e27aaff4a1b42e3f58044b643f4d32f9efc298442592f8a9b","observation_id":"f9a06bd6-238a-4eea-b4a9-7c2d921071f3","resolution":{"observed_at":"2026-08-15T22:32:45.740241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.726165Z","title":"Active sequential hypothesis testing","venue":null,"work_id":"bfe243cd-45d2-498d-9581-78bba44e6b1e","year":2013},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.929775Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:00c2b59f6c229cc460450f2d879787e37906e1a49c63579f91f30f89580981bd","observation_id":"bf7ae958-e12f-491f-998c-e9b58c7735a1","resolution":{"observed_at":"2026-08-15T22:32:45.730143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.714472Z","title":"Model-based reinforcement learning and the eluder dimension","venue":null,"work_id":"91f26f4e-4b4b-4d0f-bb98-2b53b0a6a390","year":2014},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.933138Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:c6ecc57492cc3e58a02e608597ec8913757fe828deaa16bb5677421d39d2097e","observation_id":"8dab003e-becb-4dd0-8cbf-2e26daad8b4f","resolution":{"observed_at":"2026-08-15T22:32:45.718994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16197","last_updated":"2025-03-15T19:53:31Z","snapshot_observed_at":"2026-08-16T13:15:48.375642Z","submitted_at":"2024-09-24T15:42:04Z","title":"Second Order Bounds for Contextual Bandits with Function Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16197","snapshot_observed_at":"2026-08-15T22:32:44.936395Z","title":"Second order bounds for contextual bandits with function approximation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.936395Z"},"links":{"cited_paper":"/paper/2409.16197","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f45130c49f1a301960dbcbae2c2fc948fb7b0dba4eb75bdf0ddfb207d91871a5","observation_id":"b2d6f01c-e5ff-41b7-b2ba-1ff46e826949","resolution":{"observed_at":"2026-08-15T22:32:44.936395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.703915Z","title":"Stochastic bandits with linear constraints","venue":null,"work_id":"504b1423-23c4-45a7-af8f-8095d3c2e17e","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.940637Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:01d7a163ff27bc8862108e1e561132660ec8fa1c07ca2c53d88731f17b32a1af","observation_id":"c1872654-a945-473c-8906-90a9b67a1786","resolution":{"observed_at":"2026-08-15T22:32:45.708060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.692643Z","title":"Asymptotics of sequential composite hypothesis testing under probabilistic constraints","venue":null,"work_id":"a7c26947-d77d-4a7f-b852-50a133deb36f","year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.943953Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f9ed91490195810d50842a5a51ad490b6fafdce0322e7e3e05b47e613cba4a7f","observation_id":"a93bc29a-12f1-443f-9f6b-507aa21ce920","resolution":{"observed_at":"2026-08-15T22:32:45.697225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17796","last_updated":"2024-05-28T03:47:41Z","snapshot_observed_at":"2026-08-16T13:48:48.284497Z","submitted_at":"2024-05-28T03:47:41Z","title":"Offline Oracle-Efficient Learning for Contextual MDPs via Layerwise Exploration-Exploitation Tradeoff","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17796","snapshot_observed_at":"2026-08-15T22:32:44.947516Z","title":"Offline oracle-efficient learning for contextual mdps via layerwise exploration-exploitation tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.947516Z"},"links":{"cited_paper":"/paper/2405.17796","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:0401b7855d048f34f22bba490bdc652c9d2f88eb364298f414de8768ba27cf77","observation_id":"20ea262d-3461-4187-af8c-bafca767871a","resolution":{"observed_at":"2026-08-15T22:32:44.947516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.682298Z","title":"Some aspects of the sequential design of experiments","venue":null,"work_id":"804ec2f7-d726-4d97-90dc-82c63b8cc2a5","year":1952},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.951053Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:e564ec1b5fd3a10670a4c67b2e73b68fc6f7f75237c9f56cc8cd981a6b69806f","observation_id":"61d9e1db-f6cd-4635-8822-a5a59451c4f5","resolution":{"observed_at":"2026-08-15T22:32:45.686515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.672737Z","title":"Uncertain: Modern topics in uncertainty estimation, 2024","venue":null,"work_id":"b5ec0597-a17a-48df-9bc7-2e1dca97822c","year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.954320Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:d5fd0c73771f7b336e2d12977fab52e1e8ba8a3ac80f9c38944654ed4c3d8ed3","observation_id":"576ada19-d3c6-475c-8554-cb6b7379fef0","resolution":{"observed_at":"2026-08-15T22:32:45.675962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.958291Z","title":"Eluder dimension and the sample complexity of optimistic exploration","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.958291Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:3ec68f52610ab357e24ed2e24d2a3dc1c8d772e9f0b630ec3164e2d09d3d298c","observation_id":"c25e0339-f966-43c5-b320-3c9369a7759e","resolution":{"observed_at":"2026-08-15T22:32:44.958291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.961660Z","title":"Regret-optimal controller for the full-information problem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.961660Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:3b2bd775afd561f8675f0220e31e5062a1066549f1235b2933dfd769037480ef","observation_id":"f954f3b7-ddca-4d6b-80b9-f81491894292","resolution":{"observed_at":"2026-08-15T22:32:44.961660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01244","last_updated":"2023-04-13T07:14:26Z","snapshot_observed_at":"2026-08-09T17:05:57.761096Z","submitted_at":"2021-05-04T01:51:00Z","title":"Regret-Optimal LQR Control","version":2},"cited_work":{"arxiv_id":"2105.01244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01244","snapshot_observed_at":"2026-08-15T22:32:45.170795Z","title":"Regret-Optimal LQR Control","venue":"math.OC","work_id":"3940930e-e680-41d3-bdd2-649d44eb3f6d","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.964949Z"},"links":{"cited_paper":"/paper/2105.01244","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:241eddc837fdd37dc3b6cbd5b086289600dace92b15137c8b0e9c6b6aa62565e","observation_id":"eb2a2cd9-ab29-40c8-be07-11bb5ad684b2","resolution":{"observed_at":"2026-08-15T22:32:45.174357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1111.1977","last_updated":"2013-03-13T13:12:57Z","snapshot_observed_at":"2026-08-15T04:29:34.332982Z","submitted_at":"2011-11-08T17:13:55Z","title":"On Refined Versions of the Azuma-Hoeffding Inequality with Applications in Information Theory","version":9},"cited_work":{"arxiv_id":"1111.1977","doi":null,"metadata_source":"pith","pith_arxiv_id":"1111.1977","snapshot_observed_at":"2026-08-15T22:32:45.156185Z","title":"On Refined Versions of the Azuma-Hoeffding Inequality with Applications in Information Theory","venue":"cs.IT","work_id":"82cb47c6-8d72-43b7-a741-b560a883fdff","year":2011},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.968657Z"},"links":{"cited_paper":"/paper/1111.1977","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:f263b52859781d15602b643099deb21c5233b259a382510a446351be85395345","observation_id":"f4cfeaf4-8607-443b-93c8-321fffa4c126","resolution":{"observed_at":"2026-08-15T22:32:45.160148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.655283Z","title":"Bypassing the monster: A faster and simpler optimal algorithm for contextual bandits under realizability","venue":null,"work_id":"7f8e3aa4-d330-4f90-bb90-1f4f9a76cb8e","year":2021},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.972065Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:b805e73412d2810ab66e9f1d94b518abf22531d5381da7254bf4b2e14a5de8ab","observation_id":"5e9a1592-001f-489e-a9d5-7d721b2cdd03","resolution":{"observed_at":"2026-08-15T22:32:45.659498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.642781Z","title":"Active learning for streaming data in a contextual bandit framework","venue":null,"work_id":"9c2fe39c-023b-4091-ae5d-7c588ec82198","year":2019},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.975442Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:ef8ec224da835e940df5bc3373b8ffc50fb0576d3299bfedeb99ad142bf8f823","observation_id":"332de372-c87f-4d44-8c8a-ef0ddffaf8bf","resolution":{"observed_at":"2026-08-15T22:32:45.647432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04033","last_updated":"2024-03-06T20:23:59Z","snapshot_observed_at":"2026-08-16T14:12:10.327650Z","submitted_at":"2024-03-06T20:23:59Z","title":"Online Learning with Unknown Constraints","version":1},"cited_work":{"arxiv_id":"2403.04033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04033","snapshot_observed_at":"2026-08-15T22:32:45.139321Z","title":"Online Learning with Unknown Constraints","venue":"cs.LG","work_id":"02c4a3fd-5f45-49c2-868f-456f445967a4","year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.978567Z"},"links":{"cited_paper":"/paper/2403.04033","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:e5bf4b73ad6b1edfd454956dfdf4b0bd665b22fb02b70ee396b61716b909f6c4","observation_id":"1179ebd1-7737-45ea-94b6-18201707a488","resolution":{"observed_at":"2026-08-15T22:32:45.145105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:44.982036Z","title":"l1-penalization for mixture regression models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.982036Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:38425e043f202add4c2a751d33a17703ffba65152c7c6d71d8e3765f1c89261b","observation_id":"03045525-676e-4fda-bd20-931861237b1b","resolution":{"observed_at":"2026-08-15T22:32:44.982036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12722","last_updated":"2024-01-24T04:43:05Z","snapshot_observed_at":"2026-08-16T14:25:13.359562Z","submitted_at":"2024-01-23T12:48:27Z","title":"Falcon: Fair Active Learning using Multi-armed Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12722","snapshot_observed_at":"2026-08-15T22:32:44.985354Z","title":"Falcon: Fair active learning using multi-armed bandits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.985354Z"},"links":{"cited_paper":"/paper/2401.12722","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:db46f2eb509be00176f656287906917f6017f4bf4483dd609e8d82a7c12093b1","observation_id":"dff206ab-2bdb-487e-b362-4f3ab8be9ce8","resolution":{"observed_at":"2026-08-15T22:32:44.985354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12845","last_updated":"2025-05-29T17:56:45Z","snapshot_observed_at":"2026-08-16T13:24:25.893558Z","submitted_at":"2024-08-23T05:25:58Z","title":"Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12845","snapshot_observed_at":"2026-08-15T22:32:44.989486Z","title":"Online fair division with contextual bandits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.989486Z"},"links":{"cited_paper":"/paper/2408.12845","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:fcc6247df3b6e42e6cd53f28cd573862313942408c7fcf040ceaf5fdabfbbbce","observation_id":"40e89be9-036c-4d7f-a02d-97d78e57008d","resolution":{"observed_at":"2026-08-15T22:32:44.989486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.630920Z","title":"Safe reinforcement learning in constrained markov decision processes","venue":null,"work_id":"c9c92471-ac95-411d-88f4-20a29e39ee3e","year":2020},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.993602Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:4d9b91334ce35850e333323aeecb14c1c2aebd98786dfdd2e7e09d5bd46b2213","observation_id":"d330142e-95f5-4355-98af-56719a3eff51","resolution":{"observed_at":"2026-08-15T22:32:45.634884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02025","last_updated":"2024-05-08T00:59:16Z","snapshot_observed_at":"2026-08-16T14:21:55.964853Z","submitted_at":"2024-02-03T04:40:31Z","title":"A Survey of Constraint Formulations in Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02025","snapshot_observed_at":"2026-08-15T22:32:44.997278Z","title":"A survey of constraint formulations in safe reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:44.997278Z"},"links":{"cited_paper":"/paper/2402.02025","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:8c8a656e7bc0a94c967f0f66bc605e23a8a526d64fd4b32a593daaa9d72a3e07","observation_id":"4e28d4dd-012d-4c05-b985-263f98804ed8","resolution":{"observed_at":"2026-08-15T22:32:44.997278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.619413Z","title":"Optimum character of the sequential probability ratio test","venue":null,"work_id":"a451d190-3ec4-47ff-9f23-a9684a050a15","year":1948},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.001179Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:2bb9ee18eb8fe94935920b4c16b4a88c91e3653d4874e6e5652cd8f8021aa9bb","observation_id":"35988c59-9330-43aa-86fc-da569a450f6c","resolution":{"observed_at":"2026-08-15T22:32:45.623159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.10804","last_updated":"2020-06-19T17:49:05Z","snapshot_observed_at":"2026-07-06T09:22:23.803339Z","submitted_at":"2020-05-21T17:36:09Z","title":"Reinforcement Learning with General Value Function Approximation: Provably Efficient Approach via Bounded Eluder Dimension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.10804","snapshot_observed_at":"2026-08-15T22:32:45.004845Z","title":"Provably efficient reinforcement learning with general value function approximation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.004845Z"},"links":{"cited_paper":"/paper/2005.10804","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:94043c990205422885ee430581540afacaf1f720c43960b8a1fa2443c1512604","observation_id":"20199f8d-0569-4c55-bec8-a71a86667fb2","resolution":{"observed_at":"2026-08-15T22:32:45.004845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.607217Z","title":"Reinforcement learning with general value function approximation: Provably efficient approach via bounded eluder dimension","venue":null,"work_id":"52f6c784-7960-4fa9-ad22-adb29a8436a7","year":2020},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.008569Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:c529932f42107818b2dca22b3803ecf5fd9ec74f70583dc6db48644b80f7c2e5","observation_id":"bda89715-f556-4489-85a2-0c53f14379e6","resolution":{"observed_at":"2026-08-15T22:32:45.611982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.011810Z","title":"Best arm identification with safety constraints","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.011810Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:30191824cd6cf1879fd5a45a5278a173ce42c447838707b303c2962521b91ed9","observation_id":"bf258dab-73eb-4fed-acba-e640f509d42c","resolution":{"observed_at":"2026-08-15T22:32:45.011810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.591153Z","title":"Algorithms with logarithmic or sublinear regret for constrained contextual bandits","venue":null,"work_id":"32d8b0e4-ee50-4b15-ba8b-61da2c6ef196","year":2015},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.015095Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:a6a80ff761b022e303318a6e69ed5b2c0e7453286e224f9ed1c14be571fbfbe3","observation_id":"f0349e14-b968-4dc4-ab5d-ef87a4d966be","resolution":{"observed_at":"2026-08-15T22:32:45.594815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.07876","last_updated":"2024-03-09T20:11:36Z","snapshot_observed_at":"2026-08-09T02:39:25.294620Z","submitted_at":"2020-07-15T17:50:46Z","title":"Upper Counterfactual Confidence Bounds: a New Optimism Principle for Contextual Bandits","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.07876","snapshot_observed_at":"2026-08-15T22:32:45.018388Z","title":"Upper counterfactual confidence bounds: a new optimism principle for contextual bandits","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.018388Z"},"links":{"cited_paper":"/paper/2007.07876","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:e9665485b11e87bf22b653030fb2152074f65bf50d9e321e7014d8c5edf4fc69","observation_id":"8f3ebd21-7d63-4ab5-8612-ce47c49bd6fa","resolution":{"observed_at":"2026-08-15T22:32:45.018388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.021947Z","title":"Online convex optimization with stochastic constraints","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.021947Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:581df2e33ff9d94d8d30ed2197052d9ae4c2ce6060987935a73b3e75207a4264","observation_id":"edcb858c-cb13-4cdb-bc93-c2b51e03fbd1","resolution":{"observed_at":"2026-08-15T22:32:45.021947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01962","last_updated":"2023-06-30T13:05:42Z","snapshot_observed_at":"2026-08-16T16:18:48.549126Z","submitted_at":"2022-11-03T16:42:40Z","title":"GEC: A Unified Framework for Interactive Decision Making in MDP, POMDP, and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01962","snapshot_observed_at":"2026-08-15T22:32:45.025498Z","title":"Gec: A unified framework for interactive decision making in mdp, pomdp, and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.025498Z"},"links":{"cited_paper":"/paper/2211.01962","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:4f31c98e451249b4e37fd2cb97e4698c68c21bbe0af6747c93a39700b8cc7659","observation_id":"47c9d7c4-9085-4bb1-adf0-b1723f35e652","resolution":{"observed_at":"2026-08-15T22:32:45.025498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:32:45.574690Z","title":"Spoiled for choice? personalized recommendation for healthcare decisions: A multiarmed bandit approach","venue":null,"work_id":"78e0d157-de19-41e9-9ba5-69ee42b238d6","year":2023},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.029788Z"},"links":{"citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:25b0f909be588f8660fd52b89c54f07e398b034fbed1d89ac4f61120ec6c3a01","observation_id":"af33912f-9ded-4f00-aa18-2a4beb47738d","resolution":{"observed_at":"2026-08-15T22:32:45.578281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08513","last_updated":"2018-03-16T17:50:06Z","snapshot_observed_at":"2026-08-14T20:10:54.119963Z","submitted_at":"2017-11-22T21:47:55Z","title":"Calibration for the (Computationally-Identifiable) Masses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08513","snapshot_observed_at":"2026-08-15T22:32:45.034109Z","title":"Kim, Omer Reingold, and Guy N","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T22:32:45.034109Z"},"links":{"cited_paper":"/paper/1711.08513","citing_paper":"/paper/2505.07101"},"observation_digest":"sha256:e3b02ed0eaec3a57cf1baa60116970b7bad83fc397572e0667cf28472b4cabb5","observation_id":"1da0dbeb-d54b-4f65-b54c-27d0ed44734a","resolution":{"observed_at":"2026-08-15T22:32:45.034109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07101","last_updated":"2025-05-22T14:30:05Z","latest_version":3,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-15T22:22:36.383757Z","submitted_at":"2025-05-11T19:22:04Z","title":"Constrained Online Decision-Making: A Unified Framework"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":12,"verified_fuzzy":39},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2505.07101."}