{"as_of":"2026-08-23T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01dfd744b7a2d399ba4adbe014b267ece3b77443a481b600d692c2e4f0574987","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:41:32.038712Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11560/citation-record","integrity":"/paper/2608.11560/integrity","json":"/paper/2608.11560/citation-record.json","paper":"/paper/2608.11560"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.589313Z","title":"Imbens, and Hyunseung Kang","venue":null,"work_id":"6245370d-4156-421d-b023-792166ffdb81","year":2019},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.886344Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:321da842e6dae2c0cb1fa119f490e2784aaf4bcf0f6d8dd4bc9f8e0884431f3f","observation_id":"6520674d-b2b0-400f-86e3-9e2f509dff15","resolution":{"observed_at":"2026-08-16T00:41:32.593017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.575845Z","title":null,"venue":null,"work_id":"eb1d2e6b-e3d7-4444-a409-cb5b1ef381ef","year":2024},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.891924Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:82cdb9048582874c8be7e49ab7dd3d2b96fb4a096e8581e349f3b032fd7d1c73","observation_id":"3dbe2a08-4f21-47a6-8555-139148c634fb","resolution":{"observed_at":"2026-08-16T00:41:32.580168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.562028Z","title":null,"venue":null,"work_id":"a58affde-5fb4-4ab3-b3c4-24b65e602e60","year":2016},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.896903Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:ef0ab78204a1ab75e5a6c431a80d0d9fa33adcfe9f535335afc05a2c7957caa2","observation_id":"7643c82b-a687-4d0e-bf3a-b7b07bef4dff","resolution":{"observed_at":"2026-08-16T00:41:32.565931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.548213Z","title":null,"venue":null,"work_id":"507c3182-8168-4445-94d4-39529c882fbe","year":2021},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.902148Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:7559bfaae018f94b9ab5a28ec22c17d3d695938b75ce68c854c4175daa950bde","observation_id":"0cf5338b-93f7-4a9d-954c-ce361489e27e","resolution":{"observed_at":"2026-08-16T00:41:32.552631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.533564Z","title":null,"venue":null,"work_id":"11ef6790-518d-43e0-9814-3b4abb1635c1","year":2011},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.906850Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:86e4bcfd852fe837386dd731b8ba889681657804d30749bfbff8fbce23d4f5a4","observation_id":"44c94867-1459-4bfd-9b69-47ebf26d1608","resolution":{"observed_at":"2026-08-16T00:41:32.538516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11129-023-09278-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-19T11:03:45.297681Z","title":"Hitsch, Sanjog Misra, and Walter W","venue":"Quantitative Marketing and Economics","work_id":"07eacbfd-bf22-4b86-8cab-5a518a804425","year":2024},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.911238Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:ce953833e5c32bad58d1145c21dcf1805bd1f74d30aaa366c174a871ebb0501b","observation_id":"d3602be4-c0bd-4dd0-aee9-fa224604a91d","resolution":{"observed_at":"2026-08-16T00:41:32.076113Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.519291Z","title":null,"venue":null,"work_id":"df0f134c-7e3b-402b-a6f1-35f68b11bd69","year":2024},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.916716Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:a32e629a581f6e081d698931817e7b447a8ee15f577073a792fb42e7f1ae49ea","observation_id":"c9cb16eb-4061-4e79-b425-509b6b18a46f","resolution":{"observed_at":"2026-08-16T00:41:32.523823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.505864Z","title":null,"venue":null,"work_id":"101fde4f-07e5-40df-a20f-9a6c434df3e1","year":2013},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.922436Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:3ff8b9cf6d5ef4a3b966fa6651458197bad8b7fa370503e805bc6474ddc3d84a","observation_id":"f6725adf-24c9-4247-9302-b070e868da99","resolution":{"observed_at":"2026-08-16T00:41:32.509727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:31.927681Z","title":"2020.Trustworthy Online Controlled Experi- ments: A Practical Guide to A/B Testing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.927681Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:8e3e88691929e033b6a89793926517a29bb8c50cccfbd92e6c80be9747f0c48a","observation_id":"93e97633-d5ce-4f3a-9d80-6dcb729c242c","resolution":{"observed_at":"2026-08-16T00:41:31.927681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.483508Z","title":"Schapire","venue":null,"work_id":"e06b147c-d4ef-425b-ace4-84a32137c7d1","year":2010},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.932438Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:47fd20cb6bfdc86e6c33f10bbb72bd5d1bf2ab80cda7a00cdadc83c94218800c","observation_id":"69a1633f-6f2f-4f94-9dbc-5bdc43e593eb","resolution":{"observed_at":"2026-08-16T00:41:32.487320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1003.5956","last_updated":"2012-03-01T23:33:07Z","snapshot_observed_at":"2026-08-17T13:19:32.184257Z","submitted_at":"2010-03-31T01:20:07Z","title":"Unbiased Offline Evaluation of Contextual-bandit-based News Article Recommendation Algorithms","version":2},"cited_work":{"arxiv_id":"1003.5956","doi":null,"metadata_source":"pith","pith_arxiv_id":"1003.5956","snapshot_observed_at":"2026-08-16T00:41:32.249475Z","title":"Unbiased Offline Evaluation of Contextual-bandit-based News Article Recommendation Algorithms","venue":"cs.LG","work_id":"5c912335-e572-4976-9efd-a091f7e209fb","year":2010},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.938685Z"},"links":{"cited_paper":"/paper/1003.5956","citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:f8de872e77606bd796cf78d045b263d751519829a4303f1cdf7106ee992866db","observation_id":"73a5db08-ed12-41cb-b3dc-e53d71e1133f","resolution":{"observed_at":"2026-08-16T00:41:32.261437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04585","last_updated":"2019-02-24T08:12:46Z","snapshot_observed_at":"2026-08-17T04:25:53.281214Z","submitted_at":"2018-03-13T01:15:39Z","title":"Categorizing Variants of Goodhart's Law","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04585","snapshot_observed_at":"2026-08-16T00:41:31.946714Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.946714Z"},"links":{"cited_paper":"/paper/1803.04585","citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:bdd7749312aaed8c74a20751a0d5f3c71e44a44c7496d21b9280b6bd38bc2443","observation_id":"f0016b7b-d651-4bec-b5ba-cf4f17bb6e5c","resolution":{"observed_at":"2026-08-16T00:41:31.946714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.470374Z","title":null,"venue":null,"work_id":"35be5318-aba2-43d5-9c2d-a2ab93ecf5d8","year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.954108Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:cab0438ac379f6b5997ce367578a907a24bd8cb8194269efe3f47e4b9161c58c","observation_id":"4ab43355-22ca-40d6-afc1-f209067b64b5","resolution":{"observed_at":"2026-08-16T00:41:32.474407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.441213Z","title":"Ng, Daishi Harada, and Stuart Russell","venue":null,"work_id":"3533e057-894a-4a3d-b5e7-36a70d882ea5","year":1999},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.971240Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:a10d2ad92ffa5097f19dcb0ef9ea7378775274c2d09c85ec2b966637c096ad58","observation_id":"eaacf798-4130-4ac0-b1f1-a7dfdae7bdfb","resolution":{"observed_at":"2026-08-16T00:41:32.445696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.427115Z","title":null,"venue":null,"work_id":"ec7a5571-7c91-4d26-8c0a-32f9bfdfc6d6","year":2022},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.975560Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:06ea37803b724c0786ec58b882c97e6bc9855358fa8cdeab66589554abc40080","observation_id":"34e26eb6-82f3-4235-8f58-7e60d058e875","resolution":{"observed_at":"2026-08-16T00:41:32.431808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.413170Z","title":null,"venue":null,"work_id":"53fcae88-58b8-4282-b32b-441838c615e1","year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.980166Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:5ee10be34fac80f258cb07783dbd6097d894aa21a220f6b96be3e666e1f9603f","observation_id":"cb35ae64-b59f-4c9c-aebd-775db9b07d7b","resolution":{"observed_at":"2026-08-16T00:41:32.417423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.383876Z","title":"Prentice","venue":null,"work_id":"62d2f308-dd78-4e16-b009-3902364b1168","year":1989},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.989098Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:fde4fdef2ae550da6fcbf53980e6babfdb08b5ebf9b55bc961453a2eba81ff7d","observation_id":"158bf5f9-1be5-4fa1-a599-ed4bf8d84b62","resolution":{"observed_at":"2026-08-16T00:41:32.388590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:31.993243Z","title":"Roijers, Peter Vamplew, Shimon Whiteson, and Richard Dazeley","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.993243Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:392ccdfae37876e5363d6df6856939c96075253dacfb62178d52803cb3fb766c","observation_id":"4566d10c-a888-4523-8227-05d9157ed1d8","resolution":{"observed_at":"2026-08-16T00:41:31.993243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07146","last_updated":"2021-10-26T08:57:39Z","snapshot_observed_at":"2026-08-06T10:55:10.645410Z","submitted_at":"2020-08-17T08:23:50Z","title":"Open Bandit Dataset and Pipeline: Towards Realistic and Reproducible Off-Policy Evaluation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07146","snapshot_observed_at":"2026-08-16T00:41:32.001981Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.001981Z"},"links":{"cited_paper":"/paper/2008.07146","citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:535e30d40c254279b9b723777da4ee3f15e024163ddcc143e2c27e21808503a6","observation_id":"6e8f8f9c-daf3-499f-bd49-0a4c6de68077","resolution":{"observed_at":"2026-08-16T00:41:32.001981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.007049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.007049Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:0f3a7d69ccc2dda111e0d61fbb018a703ed2c6058f18c240f05b721d50a99a0c","observation_id":"3ef44ebd-c343-4f56-8f1d-85f143fb4756","resolution":{"observed_at":"2026-08-16T00:41:32.007049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.011376Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.011376Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:e60004e7454fbf02eea6c0563752eb9022e055f553d0c71d47e1652e16ab02fb","observation_id":"f788253d-c6d0-4b6e-970d-5ca14d2ca62c","resolution":{"observed_at":"2026-08-16T00:41:32.011376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.323433Z","title":null,"venue":null,"work_id":"47ccdef7-95f8-4900-8b61-c55ab5ecc30e","year":2015},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.020725Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:fe671c332025dda9cd815a220ed3f67af4888f66e7df12053942bc39b06ca2a2","observation_id":"abb78ce0-28c4-4fe4-8b0a-90d9dda1f362","resolution":{"observed_at":"2026-08-16T00:41:32.328245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07893","last_updated":"2024-06-15T19:56:22Z","snapshot_observed_at":"2026-08-16T15:00:38.111583Z","submitted_at":"2023-09-14T17:43:02Z","title":"Choosing a Proxy Metric from Past Experiments","version":2},"cited_work":{"arxiv_id":"2309.07893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07893","snapshot_observed_at":"2026-08-16T00:41:32.107454Z","title":"Choosing a Proxy Metric from Past Experiments","venue":"stat.ME","work_id":"7da10b7f-dd67-4fd6-bf73-12e67fc3fb8a","year":2023},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.025017Z"},"links":{"cited_paper":"/paper/2309.07893","citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:a51e13ae507d9af35a40da0b4af84b639566ead981b00cecfdede9c4210eee94","observation_id":"7bc5112d-7800-49e9-bb6f-a044645e504f","resolution":{"observed_at":"2026-08-16T00:41:32.112827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.308609Z","title":"VanderWeele","venue":null,"work_id":"685f82fa-04b8-4314-a08d-e31644048506","year":2013},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.029706Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:7cb84c66e7d46ac18d4d417053ea7622c1a890d202b69c2b34b79756589b9de7","observation_id":"45767498-29a0-41da-98ba-3040a5f2fef1","resolution":{"observed_at":"2026-08-16T00:41:32.313057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.282811Z","title":null,"venue":null,"work_id":"50a1e615-30f0-434a-85db-12cd6f3751e8","year":2017},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.034462Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:b20a0c3ee501a8bbce8b17791c1dce36a205d9121687a7ec27a53a6fb87bc5ff","observation_id":"54d77dfb-20fc-4602-a09e-92e1885fe407","resolution":{"observed_at":"2026-08-16T00:41:32.299051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06854","last_updated":"2021-11-27T23:54:27Z","snapshot_observed_at":"2026-08-04T05:39:19.331954Z","submitted_at":"2019-11-15T19:58:42Z","title":"Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06854","snapshot_observed_at":"2026-08-16T00:41:32.038712Z","title":"temporal70 /30","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.038712Z"},"links":{"cited_paper":"/paper/1911.06854","citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:6ea6f29d96b90404c55da91d3db7f49169cb2532aee33d73e5296cb474c2e928","observation_id":"9d5a4b92-c198-4307-8cc6-d34cbef94587","resolution":{"observed_at":"2026-08-16T00:41:32.038712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.360935Z","title":null,"venue":null,"work_id":"c2ce56dd-c89a-448c-b59d-e59d2b88450b","year":2013},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.997400Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:28803f746a4e7da7e4249803b9abea6fd7eb7e9ba08a990ed5bc678aa7e265f5","observation_id":"7908cb71-40c0-4a00-9775-728bbabad23d","resolution":{"observed_at":"2026-08-16T00:41:32.365488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.398647Z","title":"InProceedings of the 35th International Conference on Machine Learning (ICML)","venue":null,"work_id":"282a28e3-3b2c-43a8-8f0c-1d16478856ff","year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.984484Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:63975762ddf7693cc906ab9b1d0449ba4b5a1d76b6e3f92c5d9812cd47a0973b","observation_id":"4f47815e-df40-41e4-acb1-86351e4b03cd","resolution":{"observed_at":"2026-08-16T00:41:32.403370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.337861Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"93fefd1a-c9a4-4891-9514-927818357cb3","year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:32.016154Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:708a3db952801483126d21c33544a7277827ed887b68bcd5ee440c66216da493","observation_id":"9a2a5e05-8cbd-4160-8603-709501a38f43","resolution":{"observed_at":"2026-08-16T00:41:32.342456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:41:32.456211Z","title":"InProceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD)","venue":null,"work_id":"943796d3-a66a-4262-886a-9f977232b63b","year":null},"citing_paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:41:31.961619Z"},"links":{"citing_paper":"/paper/2608.11560"},"observation_digest":"sha256:5b8db10241c2db366da6c92869ef84d6ca1a2efe1fb260f4256c7a121d12021f","observation_id":"a5c4782d-cdd8-4b16-a14e-c113d5d75aad","resolution":{"observed_at":"2026-08-16T00:41:32.460709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11560","last_updated":"2026-08-12T01:53:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-23T04:18:52.134852Z","submitted_at":"2026-08-12T01:53:21Z","title":"When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2608.11560."}