{"as_of":"2026-08-17T04:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4959b0d27eb9049011537ff3bb12e82901042d6de8fbee2d17067859e9ed18a8","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:32:12.820798Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04815/citation-record","integrity":"/paper/2509.04815/integrity","json":"/paper/2509.04815/citation-record.json","paper":"/paper/2509.04815"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.11046","last_updated":"2023-12-01T13:52:32Z","snapshot_observed_at":"2026-08-16T15:14:34.974646Z","submitted_at":"2023-07-20T17:28:01Z","title":"A Definition of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11046","snapshot_observed_at":"2026-08-15T16:32:12.684556Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.684556Z"},"links":{"cited_paper":"/paper/2307.11046","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:cc94d6be5c783fe571c5393f6d2ac245394c8ccd7143dfe184e9ac0a5711d117","observation_id":"b0c2071b-d611-486c-ba19-c2a27d812a64","resolution":{"observed_at":"2026-08-15T16:32:12.684556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04543","last_updated":"2020-06-22T04:32:50Z","snapshot_observed_at":"2026-08-14T16:07:12.924820Z","submitted_at":"2019-07-10T07:23:27Z","title":"An Optimistic Perspective on Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04543","snapshot_observed_at":"2026-08-15T16:32:12.689193Z","title":"Agarwal, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.689193Z"},"links":{"cited_paper":"/paper/1907.04543","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:edb0b4f0058c8f5090ccd254f3da66f63c471636251a869948526d0d37c14032","observation_id":"80a059ca-65cb-4687-9ac0-1fbd292a5d79","resolution":{"observed_at":"2026-08-15T16:32:12.689193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01929","last_updated":"2017-03-10T09:52:52Z","snapshot_observed_at":"2026-08-16T04:02:20.909761Z","submitted_at":"2016-11-07T08:12:53Z","title":"Averaged-DQN: Variance Reduction and Stabilization for Deep Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1611.01929","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.01929","snapshot_observed_at":"2026-08-15T16:32:13.401036Z","title":"Averaged-DQN: Variance Reduction and Stabilization for Deep Reinforcement Learning","venue":"cs.AI","work_id":"31ee9dc5-f402-4832-9999-5045dce99e9f","year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.694140Z"},"links":{"cited_paper":"/paper/1611.01929","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:8e91408480d2670d2993280860387547a10fb2109babfaf52fd84b36ae2b7a90","observation_id":"90e46a99-ea99-48ff-8cef-637c74e0e4ac","resolution":{"observed_at":"2026-08-15T16:32:13.405978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06887","last_updated":"2017-07-21T13:21:54Z","snapshot_observed_at":"2026-08-16T02:49:43.047943Z","submitted_at":"2017-07-21T13:21:54Z","title":"A Distributional Perspective on Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06887","snapshot_observed_at":"2026-08-15T16:32:12.699176Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.699176Z"},"links":{"cited_paper":"/paper/1707.06887","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:b0ac49904c12e1c723c661cfad165c10d040ca66d8c407259582a208730a5111","observation_id":"f32fefd8-8e9a-4eef-9c90-86c48d4885bc","resolution":{"observed_at":"2026-08-15T16:32:12.699176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"gov/2143556","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.372212Z","title":null,"venue":null,"work_id":"a0fef202-19c8-4942-acad-ee669e40907a","year":2011},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.703447Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:4fea9301f32120f7e3914b10e9c29fc09acccb29fd0cca0bf9f12c56cc180dc9","observation_id":"848c583f-d52d-4bd8-95d9-0b2147424300","resolution":{"observed_at":"2026-08-15T16:32:13.377658Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.10295","last_updated":"2019-07-09T09:57:23Z","snapshot_observed_at":"2026-08-16T02:29:41.156593Z","submitted_at":"2017-06-30T17:56:19Z","title":"Noisy Networks for Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.10295","snapshot_observed_at":"2026-08-15T16:32:12.707519Z","title":"Fortunato, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.707519Z"},"links":{"cited_paper":"/paper/1706.10295","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:213f8e88a17ebe5dbcfb9090f59590f3147e20a5612d67e19dbbd608287ad4b2","observation_id":"6b801350-c177-4d70-99d9-5e538633deab","resolution":{"observed_at":"2026-08-15T16:32:12.707519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.506431Z","title":"Gl \\\"a scher, R","venue":null,"work_id":"f63607c1-4db1-4805-b181-45e2586ff85c","year":2012},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.711758Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:90aa09fb9ddf9003e65d6b8d70e842bf1e48abcec74cf4218ac015f72c895600","observation_id":"0497429f-2440-4e08-9fe0-dde679a9c566","resolution":{"observed_at":"2026-08-15T16:32:13.510565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-14T22:31:25.126692Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-15T16:32:12.716344Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.716344Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:4d7208bed6c61af0788afab76ba78c2df7785efb5e2dadcf2288ddf9b476fe48","observation_id":"25b4b8a6-4d4a-4b82-b10f-adb1da5db636","resolution":{"observed_at":"2026-08-15T16:32:12.716344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.02298","last_updated":"2017-10-06T07:45:46Z","snapshot_observed_at":"2026-08-14T20:26:19.477032Z","submitted_at":"2017-10-06T07:45:46Z","title":"Rainbow: Combining Improvements in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.02298","snapshot_observed_at":"2026-08-15T16:32:12.719996Z","title":"Hessel, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.719996Z"},"links":{"cited_paper":"/paper/1710.02298","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:7f4a7306f9bfa71ae9bb7b7154e155554d04e99b66aaf4db5032221147df2cf6","observation_id":"75a286e1-bbd8-4466-9186-c368a88e452b","resolution":{"observed_at":"2026-08-15T16:32:12.719996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07841","last_updated":"2021-10-25T19:43:52Z","snapshot_observed_at":"2026-08-16T18:17:09.227857Z","submitted_at":"2021-06-15T02:23:07Z","title":"Randomized Exploration for Reinforcement Learning with General Value Function Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07841","snapshot_observed_at":"2026-08-15T16:32:12.723333Z","title":"Ishfaq, Q","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.723333Z"},"links":{"cited_paper":"/paper/2106.07841","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:7570dd9977a2729e832e1cf6741404a95da3f1041daa60c39777deb1fe828238","observation_id":"87527406-39a9-4239-b971-1dcfc16803aa","resolution":{"observed_at":"2026-08-15T16:32:12.723333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15382","last_updated":"2021-11-30T13:28:13Z","snapshot_observed_at":"2026-08-16T22:57:22.240620Z","submitted_at":"2021-11-30T13:28:13Z","title":"Continuous Control With Ensemble Deep Deterministic Policy Gradients","version":1},"cited_work":{"arxiv_id":"2111.15382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.15382","snapshot_observed_at":"2026-08-15T16:32:13.277163Z","title":"Continuous Control With Ensemble Deep Deterministic Policy Gradients","venue":"cs.LG","work_id":"fdbe73a6-b8e9-4b8d-b5ef-a9a8e5d1ec05","year":2021},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.727288Z"},"links":{"cited_paper":"/paper/2111.15382","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:2cac4bd11b90acdb4533a4489cea594e64b713eb5e6d10c3c0d69d8bca56f8c6","observation_id":"2c184e29-7800-4ad7-ad7f-687df1c37bf4","resolution":{"observed_at":"2026-08-15T16:32:13.281562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13490","last_updated":"2022-11-11T23:12:23Z","snapshot_observed_at":"2026-08-16T18:56:03.773500Z","submitted_at":"2020-12-25T02:35:27Z","title":"Towards Continual Reinforcement Learning: A Review and Perspectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13490","snapshot_observed_at":"2026-08-15T16:32:12.731129Z","title":"Khetarpal, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.731129Z"},"links":{"cited_paper":"/paper/2012.13490","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:2256291c0a78524b420dab28e28dc97313a8f6e1bcd14d5113807d7e113a7ede","observation_id":"deb8b41d-badc-49a6-bca1-64bc014b8cf4","resolution":{"observed_at":"2026-08-15T16:32:12.731129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-019-13632-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:12.865849Z","title":null,"venue":null,"work_id":"8789ed56-2477-4b15-904b-c7808c0cb506","year":2019},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.735687Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:deff5999e067d38c84d4ac9e62f1507aac50d2aa5eab992101a727b211eb2994","observation_id":"65b9a3a4-ee08-402e-928f-ded427b2e4de","resolution":{"observed_at":"2026-08-15T16:32:12.869175Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:12.739877Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.739877Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:d4e971985de4a1e760d408861595849f9c97470ffc7f0f340d2724acc7bc8572","observation_id":"93f97fba-314c-4ad2-8ad4-4ca83999cfaa","resolution":{"observed_at":"2026-08-15T16:32:12.739877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.494079Z","title":null,"venue":null,"work_id":"e7381685-c8f4-4bb1-88ef-73f9acbd74ff","year":2021},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.743904Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:055fcb1ec33b31295c8b2e68e44237319465263afe92dae6ab716dc70e81b8dd","observation_id":"c53a9a82-5ac5-4b06-8001-4270af2f6229","resolution":{"observed_at":"2026-08-15T16:32:13.498149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neuron.2013.11.028/attachment/168f1afc-b6b7-4349-b318-a51f17d5fafb/mmc1.pdf","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:12.851281Z","title":null,"venue":null,"work_id":"cb69c119-76da-4df9-aecf-13db27c9c437","year":2014},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.748012Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:12ffdf7d1d5dd5677b8557339d05fc2156b803b1fc06528212e90d651f99bb0a","observation_id":"91cb9cb0-4b16-48f0-8860-5945bf7a783a","resolution":{"observed_at":"2026-08-15T16:32:12.856456Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04342","last_updated":"2024-05-07T14:14:50Z","snapshot_observed_at":"2026-08-16T13:54:39.996145Z","submitted_at":"2024-05-07T14:14:50Z","title":"The Curse of Diversity in Ensemble-Based Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04342","snapshot_observed_at":"2026-08-15T16:32:12.751332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.751332Z"},"links":{"cited_paper":"/paper/2405.04342","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:d38b7b02a362d56f3f56663b9d6b869d1ce50f9931f94bdc3a897916f06f569a","observation_id":"e184c1e9-53af-407e-9a3f-e3bf662a162a","resolution":{"observed_at":"2026-08-15T16:32:12.751332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-15T16:32:12.755668Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.755668Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:cb33f32c5dd3d7bd4f0aa3b7d614993e18df1926b58f19956530f019cc543645","observation_id":"8e3524b2-8c83-4051-b794-09d1853a9c05","resolution":{"observed_at":"2026-08-15T16:32:12.755668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.483210Z","title":null,"venue":null,"work_id":"c400b83a-207c-48c1-905f-dac56ea9aef1","year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.760131Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:a5bbe9c35a17b767b31b9b76f07edec77bae3620a70939679ecaafa6539d99d0","observation_id":"e612f9b1-1747-42e1-b835-b2b421f4953e","resolution":{"observed_at":"2026-08-15T16:32:13.486525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01502","last_updated":"2017-11-07T20:45:59Z","snapshot_observed_at":"2026-08-14T20:55:58.284097Z","submitted_at":"2017-06-05T19:01:26Z","title":"UCB Exploration via Q-Ensembles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01502","snapshot_observed_at":"2026-08-15T16:32:12.763857Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.763857Z"},"links":{"cited_paper":"/paper/1706.01502","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:33a93b7aada8288f2c402dac9b11171ca89cc5e56b5ad5523c807c49caeceab6","observation_id":"27d31070-631b-4776-91fc-b457c6fc0f66","resolution":{"observed_at":"2026-08-15T16:32:12.763857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.04621","last_updated":"2016-07-04T17:11:52Z","snapshot_observed_at":"2026-08-14T22:10:20.275122Z","submitted_at":"2016-02-15T10:54:20Z","title":"Deep Exploration via Bootstrapped DQN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.04621","snapshot_observed_at":"2026-08-15T16:32:12.768406Z","title":"Osband, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.768406Z"},"links":{"cited_paper":"/paper/1602.04621","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:86d8111e87cb23f5d84f2c4d8ce8e227a9a321a94e89b7ddbabee28c91d239e9","observation_id":"79af5860-86d4-4cce-9832-826cc6439f45","resolution":{"observed_at":"2026-08-15T16:32:12.768406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.473137Z","title":"Osband, C","venue":null,"work_id":"f49b31b1-5449-49fa-9b1c-3041ec8beda7","year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.772364Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:9cfd839c983667fc1c6ef813c21d1cb47bb4dc845af2b0788ff14d451e299329","observation_id":"cdb9adfe-f792-4810-b19f-ce2a08c2ef8b","resolution":{"observed_at":"2026-08-15T16:32:13.476499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01310","last_updated":"2017-06-14T13:56:28Z","snapshot_observed_at":"2026-08-14T21:13:38.841867Z","submitted_at":"2017-03-03T19:07:53Z","title":"Count-Based Exploration with Neural Density Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01310","snapshot_observed_at":"2026-08-15T16:32:12.776053Z","title":"Ostrovski, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.776053Z"},"links":{"cited_paper":"/paper/1703.01310","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:08999c0b4533de9c2afce62e32a34de523d206e9b947e84842a1acd32b93444b","observation_id":"3fd6ba6b-8c1c-42de-b810-e5afae33737e","resolution":{"observed_at":"2026-08-15T16:32:12.776053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00445","last_updated":"2021-04-20T11:01:36Z","snapshot_observed_at":"2026-08-16T18:42:27.920383Z","submitted_at":"2021-02-28T10:19:47Z","title":"Ensemble Bootstrapping for Q-Learning","version":2},"cited_work":{"arxiv_id":"2103.00445","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.00445","snapshot_observed_at":"2026-08-15T16:32:13.142249Z","title":"Ensemble Bootstrapping for Q-Learning","venue":"cs.LG","work_id":"e24af278-6a51-4cc1-81e9-d18dbd28a1c0","year":2021},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.779849Z"},"links":{"cited_paper":"/paper/2103.00445","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:112b5cff492b06e7a93a895be41d16a5fe1e9be6385479f218f03f9af0245ba5","observation_id":"33d0c9db-9452-4177-9541-c813feeafd27","resolution":{"observed_at":"2026-08-15T16:32:13.146108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"gov/2257238","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.123297Z","title":null,"venue":null,"work_id":"34f83ca7-62ab-45f6-9df8-150d5f89f188","year":2012},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.783685Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:a1550adc888b5bf1bd797fca0af6f546bdfe8b28681c2ca426728c16786eab6c","observation_id":"9a8cba07-b7ca-480a-8ceb-294836cf3a5d","resolution":{"observed_at":"2026-08-15T16:32:13.129586Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:12.787308Z","title":"Saphal, B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.787308Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:1bfaeb5b6175771f76311f6f019364877e74bead33717875149af959cafe7f93","observation_id":"c033b81b-d18c-47ed-98a8-d0f729813f39","resolution":{"observed_at":"2026-08-15T16:32:12.787308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-15T16:32:12.791860Z","title":"Schaul, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.791860Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:bb6d2c93f122b4e8334fad1563edf33beb11604bf04fbcb76785037554149bd9","observation_id":"78d58b98-48b6-4985-b088-636018bd5459","resolution":{"observed_at":"2026-08-15T16:32:12.791860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11583","last_updated":"2019-11-18T12:51:59Z","snapshot_observed_at":"2026-08-12T05:32:49.871660Z","submitted_at":"2019-09-25T16:20:46Z","title":"Off-Policy Actor-Critic with Shared Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11583","snapshot_observed_at":"2026-08-15T16:32:12.795306Z","title":"Schmitt, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.795306Z"},"links":{"cited_paper":"/paper/1909.11583","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:42b76aeb4c3fe54779e8e9b99ac05332383820185c5800e8f028791d29905fbb","observation_id":"783cf942-8e64-4c30-a71c-22dad2b9379a","resolution":{"observed_at":"2026-08-15T16:32:12.795306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:12.798809Z","title":"Sutton and A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.798809Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:00c057f0e563d07c797ec693f97621886a34923689669622aa9ce46cd27cdc49","observation_id":"612ace01-1374-48fe-bb94-edbd8ac504dd","resolution":{"observed_at":"2026-08-15T16:32:12.798809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:12.802389Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.802389Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:0d3efe8363d5dca4786e11ab85c7bbbc81c96391baa309b713029a689f6bf7eb","observation_id":"25e81015-7609-4449-b38b-fa4462087582","resolution":{"observed_at":"2026-08-15T16:32:12.802389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.462835Z","title":"Thangarajah, F","venue":null,"work_id":"6ac6a25a-3cb1-4d93-840d-f68e83335b81","year":2018},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.806168Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:d06ca4f46559827044a0143807b7a3b04acbe0f69b064abe023efa05423cfe99","observation_id":"57752963-fb7b-4269-9b23-70104442ebb6","resolution":{"observed_at":"2026-08-15T16:32:13.466235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05175","last_updated":"2024-03-08T09:32:43Z","snapshot_observed_at":"2026-08-16T14:11:40.787029Z","submitted_at":"2024-03-08T09:32:43Z","title":"Continual Learning and Catastrophic Forgetting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05175","snapshot_observed_at":"2026-08-15T16:32:12.809530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.809530Z"},"links":{"cited_paper":"/paper/2403.05175","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:bdcea9d85953b3ca27dd15065becaec1ade626fb982a2c9d6a296fdb025ffe61","observation_id":"81f2a908-a3b6-4d8f-8245-6725c44f2d91","resolution":{"observed_at":"2026-08-15T16:32:12.809530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06581","last_updated":"2016-04-05T09:03:06Z","snapshot_observed_at":"2026-08-14T22:22:03.335514Z","submitted_at":"2015-11-20T13:07:54Z","title":"Dueling Network Architectures for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06581","snapshot_observed_at":"2026-08-15T16:32:12.813302Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.813302Z"},"links":{"cited_paper":"/paper/1511.06581","citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:09f5f5fb0074221c041b06c3f06116c172d72b90a34fc4367e1181db84880529","observation_id":"d0346254-a34c-4da0-ad93-a5f8ee50d6cb","resolution":{"observed_at":"2026-08-15T16:32:12.813302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.450328Z","title":null,"venue":null,"work_id":"d7732749-a137-4bf8-80d9-8fe3f6d6dc40","year":2021},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.817215Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:f10c34cfc0fef39be874454c0b4f1b382807355221a5a051e5928c8137b0d1f5","observation_id":"0b42bfee-1b8c-48de-8a7f-6addf8c816cb","resolution":{"observed_at":"2026-08-15T16:32:13.454855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:13.438911Z","title":"Borkar and S","venue":null,"work_id":"2a74fe48-5112-45c9-ab36-f28f57a4da26","year":2000},"citing_paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T16:32:12.820798Z"},"links":{"citing_paper":"/paper/2509.04815"},"observation_digest":"sha256:e81fde514b6f88c9141a309a18753ebc5220f80e0ff0d014f623b050d0dc196e","observation_id":"11e498c3-0e35-4e39-88dc-4f137e6fa734","resolution":{"observed_at":"2026-08-15T16:32:13.442717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04815","last_updated":"2025-09-05T05:28:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:01:46.504683Z","submitted_at":"2025-09-05T05:28:52Z","title":"An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":7,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2509.04815."}