{"as_of":"2026-08-12T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f59a43431e4ab78c3dd081bccb5462e6bd15cba8f5d66bc5c42671af887441d","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:12:49.665075Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00030/citation-record","integrity":"/paper/2507.00030/integrity","json":"/paper/2507.00030/citation-record.json","paper":"/paper/2507.00030"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:51.448837Z","title":"Bellemare and others","venue":null,"work_id":"ce772a60-8480-481c-b14e-84357885f036","year":2013},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:48.475803Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:f1e94aa057933c3984c1a7b084add3f4e9ea36d6b8e37325d965585be31daaae","observation_id":"4e1a3798-0d25-4f56-b343-8670aff436f4","resolution":{"observed_at":"2026-08-07T00:12:51.530869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:51.324645Z","title":"Frame skip is a powerful parameter for learning to play Atari","venue":null,"work_id":"9684cbc1-09a5-4b42-9cff-e3027d854e30","year":2015},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:48.543454Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:6f6ab7249b459907b70783b752fc9b9e0b135143f78ce7ce3b3539dab0237718","observation_id":"3567d400-933f-469b-b9bb-2ca1b7f304a1","resolution":{"observed_at":"2026-08-07T00:12:51.398444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:51.195259Z","title":"Gilbert and Timothy D","venue":null,"work_id":"ee5d7b72-e34c-4e81-98e2-41f536552e10","year":2007},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:48.647439Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:92bf6f67b5775739171b92a0bfc81be73900f13352a001941287b0c46783de7e","observation_id":"335db7ef-2e9f-4867-8c0d-da5f348a8d89","resolution":{"observed_at":"2026-08-07T00:12:51.272890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:51.005225Z","title":"Lakshminarayanan and others","venue":null,"work_id":"a95c0e3c-0184-41e2-ae0e-7b4a28c35dfb","year":2017},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:48.777519Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:cf9a8e16b2ea3271b56ca3c569e95689a7eaea31ce92b0a5810b0b1e42e32294","observation_id":"a555fbe8-65b9-41fd-8310-f78551845d19","resolution":{"observed_at":"2026-08-07T00:12:51.099339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:50.839483Z","title":"A contextual-bandit approach to personalized news article recommendation","venue":null,"work_id":"ed2dafc5-9ee5-4211-9c63-80d6828add86","year":2010},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:48.881659Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:61e60a5d7a9940363ad702445fcab275d3687045eaef7862c9455d233f686669","observation_id":"491d555f-1113-4195-b209-78488a0a87e3","resolution":{"observed_at":"2026-08-07T00:12:50.919715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:50.679396Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"8a30888b-9a25-4311-a021-cb7f2c270798","year":2015},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:48.954347Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:e16ff495de91a99108fcc13b5ddbdbf482c66d8f941863d5c580961b6db34749","observation_id":"6bf59c52-fba4-4fd7-a67d-3803fe9168ce","resolution":{"observed_at":"2026-08-07T00:12:50.740473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:50.511911Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"5ed47940-b8bd-431c-a943-7c10d76e3097","year":1928},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:49.014473Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:52137577bebed4d6f690b3fe070b60da3af9250822ea2d16a844b14ce6f102b2","observation_id":"b9ff5d85-7e5b-45f0-82f3-613ccedff340","resolution":{"observed_at":"2026-08-07T00:12:50.590134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:50.338737Z","title":"Mastering the game of Go with deep neural networks and tree search","venue":null,"work_id":"6f4fa5c8-401e-4376-a9f9-d64a7b5a7f7d","year":2016},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:49.154324Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:c3c801ecc8405cbc5e96da9f97a4e82e38462e38a96071a438b7b1abf87527c9","observation_id":"0e8db6ed-34d1-402c-9815-b9aabcb59659","resolution":{"observed_at":"2026-08-07T00:12:50.419941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:12:50.174566Z","title":"Sutton and others","venue":null,"work_id":"adda55de-23f9-4e58-85d6-bb8e4c217623","year":1999},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:49.316626Z"},"links":{"citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:4add38fa7e5e94368ed4f0628a7124c0ee3f6abca95ab9bd3fb9ffe46e00fc44","observation_id":"26e464ee-730c-4a27-95b4-e2089cef3724","resolution":{"observed_at":"2026-08-07T00:12:50.250126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1310.0713","last_updated":"2014-01-27T09:34:20Z","snapshot_observed_at":"2026-08-12T09:59:34.147881Z","submitted_at":"2013-10-02T14:15:42Z","title":"Effect of scalar leptoquarks on the rare decays of B_s meson","version":3},"cited_work":{"arxiv_id":"1310.0713","doi":null,"metadata_source":"pith","pith_arxiv_id":"1310.0713","snapshot_observed_at":"2026-08-07T00:12:49.772800Z","title":"Effect of scalar leptoquarks on the rare decays of B_s meson","venue":"hep-ph","work_id":"13cec410-7e1d-48d8-b3f3-f44d5c3d32c0","year":2013},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:49.524676Z"},"links":{"cited_paper":"/paper/1310.0713","citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:2dce0cf9f3788bba098232efbdcc2ffc2224190e18fef6e05f84e697e55927f5","observation_id":"4aabe205-466b-4c2b-a5c5-00452fb8a38b","resolution":{"observed_at":"2026-08-07T00:12:49.836013Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08232","last_updated":"2018-11-21T15:40:37Z","snapshot_observed_at":"2026-08-12T08:39:16.683473Z","submitted_at":"2017-11-22T11:24:59Z","title":"A gradient estimate for nonlocal minimal graphs","version":4},"cited_work":{"arxiv_id":"1711.08232","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.08232","snapshot_observed_at":"2026-08-07T00:12:49.969239Z","title":"A gradient estimate for nonlocal minimal graphs","venue":"math.AP","work_id":"2a016e03-63d0-4150-a141-33f3c2367dd8","year":2017},"citing_paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:12:49.665075Z"},"links":{"cited_paper":"/paper/1711.08232","citing_paper":"/paper/2507.00030"},"observation_digest":"sha256:0a7c9413fcb081260452d5dff6c561c1ec99a05b8ea9c5e6e4a107da8089b036","observation_id":"9daf9023-c8d9-4a86-93e8-5808381c8ac9","resolution":{"observed_at":"2026-08-07T00:12:50.085655Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00030","last_updated":"2025-06-17T20:04:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:07:08.064744Z","submitted_at":"2025-06-17T20:04:53Z","title":"Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2507.00030."}