{"as_of":"2026-08-12T19:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c96a21379389addd93fed711ad199a9c75f0d523e7406a3b3ba26c90242177cf","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:57:09.116234Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:54:00.193317Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02516","snapshot_observed_at":"2026-08-01T18:54:00.193317Z","title":"Russo and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-07T00:34:27.724747Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.193317Z"},"links":{"cited_paper":"/paper/2502.02516","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:8f681d88f8796e7216476613c7f86ea88c263f38b7a6807d5aca9d6b4788dbad","observation_id":"661319d6-b19e-4270-8ce8-866f141e0195","resolution":{"observed_at":"2026-08-01T18:54:00.193317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02516/citation-record","integrity":"/paper/2502.02516/integrity","json":"/paper/2502.02516/citation-record.json","paper":"/paper/2502.02516"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.391993Z","title":"Define now the policy π(u|s) = P (u|s, π(s))","venue":null,"work_id":"2ec6768f-ab32-4a5f-8ff0-9fdee1595a6b","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.029865Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:707e47d5fa51e05a8c2707c02a0410754ab71c73819070cb49dd717c72681bd5","observation_id":"f81defeb-c1ed-4883-805f-fa8c0d194bce","resolution":{"observed_at":"2026-08-09T11:57:09.396885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.361201Z","title":null,"venue":null,"work_id":"db4f83c6-6812-4531-9c04-3e38ad3c47fc","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.041873Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:6f1dd1da23d711ab65f5ce6724a4b81a1919fbe5e1519751e907d658f324ecf1","observation_id":"18a61155-b45b-43a1-b567-3bf2bd923696","resolution":{"observed_at":"2026-08-09T11:57:09.366261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.376969Z","title":null,"venue":null,"work_id":"09248988-e72b-45a1-b405-72fa1381b7df","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.035422Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:2c36a9cf4371eb8ebd435cfec55a271ae6a3870c78425c1d788e88f0d1751707","observation_id":"095938ef-068c-4a9e-a1e7-1d1be90e62f5","resolution":{"observed_at":"2026-08-09T11:57:09.381993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.264448Z","title":null,"venue":null,"work_id":"bab7beae-639e-43f2-b849-42b939c960b1","year":2024},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.091686Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:2e5142cc05681000bd87183a207c7e1a5209aeef7ae42c4e07246e679a69fe98","observation_id":"38ebd29f-8653-48fa-bda1-0ce07e72259f","resolution":{"observed_at":"2026-08-09T11:57:09.269649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.345440Z","title":null,"venue":null,"work_id":"0c3be275-b448-4c56-984c-5a3b2f7f74ca","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.048682Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:17a977728fc69f2b2b8c1dde96106aa2c4024a82d9631f453a58cc6a4d884d0d","observation_id":"9273a68d-b490-4b9a-985f-f1ef5d939d49","resolution":{"observed_at":"2026-08-09T11:57:09.350101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.330163Z","title":"sufficient","venue":null,"work_id":"a6f1c436-465d-4538-969a-89c3a8afd2f8","year":2006},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.054503Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:f4f08b49cd1764ff7720a96d4094988ea96c908a2aef9b06871ba3801c56211a","observation_id":"5cf64e25-2ccc-4458-a23b-fa870086c120","resolution":{"observed_at":"2026-08-09T11:57:09.335207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.314151Z","title":"This choice encourages to select under-sampled actions for β >0, while for β = 0 we obtain a uniform forcing policy πf,t(a|s) = 1/A","venue":null,"work_id":"e9ec900a-d60d-4409-848b-496b85a8b676","year":2024},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.064185Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:90736936c0842c1106df631688aa9f05006562590c827d63d49d859255ca323b","observation_id":"9dbe6623-bd68-49ff-8fda-fbac3738d90c","resolution":{"observed_at":"2026-08-09T11:57:09.319452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.298497Z","title":"Then, such solution induces an ergodic (irreducible and aperiodic) chain by Assumption 3.1 and Assumption 5.1","venue":null,"work_id":"693cc2a2-d0e9-4315-94cd-173fbf9cdd4e","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.075723Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:219981d20e6e691ecfcb1638a44d244645925723ace05e0692a8baacf3545921","observation_id":"4c40abb8-cd42-4a39-ac6e-c57ced12dd03","resolution":{"observed_at":"2026-08-09T11:57:09.303737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.282808Z","title":null,"venue":null,"work_id":"3807d9ca-21bc-4af8-8616-a74292fd319a","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.084632Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:039d178e2b34b83ed56eb2ebc58e2c5b1b5e219132e4561f38d0ec2941f23f5b","observation_id":"9a96dabc-1749-4a6c-b267-a3e29c11f82d","resolution":{"observed_at":"2026-08-09T11:57:09.287755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.247809Z","title":null,"venue":null,"work_id":"4560a839-ef13-41fe-99dd-1da31c798eb6","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.098369Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:9a2f8e4f820ce885cf2d2cab842f902e9242f53bb1fa55d1a2feb7031e80a2e9","observation_id":"9846c2a1-5e65-4537-9661-21aa528875c4","resolution":{"observed_at":"2026-08-09T11:57:09.253084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.230881Z","title":"On the other hand, in the single-policy scenario we use a default target policy policy πdef that is different for each environment","venue":null,"work_id":"5063fd88-315f-4aab-bda1-0e522ab3682e","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.103954Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:b8d92914b88473afbc2ed67b9a657be1a516e0825fab86288c59df46e9b23608","observation_id":"dd763a3e-bbe3-4d47-a287-9b0accf62d59","resolution":{"observed_at":"2026-08-09T11:57:09.236354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.210060Z","title":"For the reward free case we use Rcanon to perform evaluation","venue":null,"work_id":"d23788b5-8bca-49d9-b961-5743f59b6846","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.110031Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:ae2d7a0bb02caa01622b5a0bea98a9197640e27ed59715c04f1fcd12ab00bfc5","observation_id":"73fd5463-4a96-43fc-8001-b8559bbc02da","resolution":{"observed_at":"2026-08-09T11:57:09.216143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:09.190838Z","title":null,"venue":null,"work_id":"a9c73c94-2a90-418f-b304-ff5c8efe5e10","year":null},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.116234Z"},"links":{"citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:da6ac9dd3cfda2b876a17111274477df06bd24d0a8738cb59f3d882c6b67c3c6","observation_id":"32fadcb6-8f4e-4849-9e20-e03dda2e8ab1","resolution":{"observed_at":"2026-08-09T11:57:09.196812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02735","last_updated":"2025-03-04T15:55:55Z","snapshot_observed_at":"2026-08-09T14:43:52.153825Z","submitted_at":"2025-03-04T15:55:55Z","title":"Clustered KL-barycenter design for policy evaluation","version":1},"cited_work":{"arxiv_id":"2503.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.02735","snapshot_observed_at":"2026-08-09T11:57:09.169384Z","title":"Clustered KL-barycenter design for policy evaluation","venue":"cs.LG","work_id":"75e84fb2-4261-4c54-9d9a-b3ded07b5b0a","year":2025},"citing_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"reference_index":418,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:09.021310Z"},"links":{"cited_paper":"/paper/2503.02735","citing_paper":"/paper/2502.02516"},"observation_digest":"sha256:ef966874207409fedc944f49fd285ccb8ef948da3d44b8bd48b2bb85c83aeaf1","observation_id":"b03f0c00-833f-4b14-9a34-9ed35b420fcb","resolution":{"observed_at":"2026-08-09T11:57:09.177406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:42:52.111176Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 1 inbound Pith citation observation for arXiv:2502.02516."}