{"as_of":"2026-08-19T23:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddd0481be893cd2d055f8105e72788d5bcfd0c538f52426bc6b5d3c08941e750","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:14:03.900092Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.19478/citation-record","integrity":"/paper/2506.19478/integrity","json":"/paper/2506.19478/citation-record.json","paper":"/paper/2506.19478"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:07.146296Z","title":"N(µ 2, σ2 2)) distributed rewards","venue":null,"work_id":"905c6569-40b4-4f40-985e-c12265a006d7","year":null},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:02.256253Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:505f6f60eaab1f0c37810d9546ebbfa8c5a8991890893726e16daa95d5ff61d3","observation_id":"6b58787e-adc2-4345-9442-380a38372e8a","resolution":{"observed_at":"2026-08-06T23:14:07.274394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:06.899399Z","title":null,"venue":null,"work_id":"e507139c-9f86-4f08-8461-f6e991f86bbd","year":2020},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:02.523971Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:c7f30569fae8d578e392ba3d8746cd548e2a7d9254646a9d654ed1df2b15125b","observation_id":"1f0873cc-b2c5-46f5-b637-ed0c559a9042","resolution":{"observed_at":"2026-08-06T23:14:07.024193Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:06.069040Z","title":null,"venue":null,"work_id":"64676b71-1e5e-4dc8-a0f0-415c0bf3b249","year":null},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:02.945633Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:cebb9ff8bfc778e6887500095448b6e39f0b240aa49139b125bb0474367ff7ef","observation_id":"57272fa8-0012-472b-9465-b101f58a8957","resolution":{"observed_at":"2026-08-06T23:14:06.200827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:05.742736Z","title":null,"venue":null,"work_id":"608c2fc3-7614-4985-b262-46d9db21ab56","year":2010},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.071047Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:1d8ccfe4aa736f993a42ae3d208fab04f9cdb962c2a0ee6d961f960c7400b6b8","observation_id":"527420bf-ee6c-4d98-99c0-87c20539fcf1","resolution":{"observed_at":"2026-08-06T23:14:05.933292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:06.577857Z","title":null,"venue":null,"work_id":"5066dccc-0053-401d-9802-b9eb638230c0","year":null},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:02.711844Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:ffc556a8bf88f0e9ffd81f217cb6edff83c92035e2cbc382c0ec2f380c1a4323","observation_id":"57d6f0a1-8c3c-44dd-b9f7-6b49309e41b9","resolution":{"observed_at":"2026-08-06T23:14:06.735255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:05.501302Z","title":", dsuch that Fn is Fn+1-measurable and for alli= 1,","venue":null,"work_id":"14007c1b-0e6f-4da9-b65c-15eb118e0485","year":null},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.327831Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:d95667089945d338bd6c134067579c4b0bc987c7f015e006c70915a7f140956a","observation_id":"c71b2eca-c759-432f-93cc-16b2c4d4ca6f","resolution":{"observed_at":"2026-08-06T23:14:05.616463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:05.220141Z","title":", dis adapted with ∞X n=1 αi,n =∞and ∞X n=1 α2 i,n <∞a.s","venue":null,"work_id":"a9494767-dc73-405c-907d-559ea10a7359","year":2018},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.420474Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:e1866d681624b4950783419cd5a484898af7ba7d8073146f566740e36a19b763","observation_id":"ab87d9cf-f490-4e43-b9fc-27c55dc9a23a","resolution":{"observed_at":"2026-08-06T23:14:05.335693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:04.944787Z","title":null,"venue":null,"work_id":"5d019eeb-bde0-4175-982a-e144bec34560","year":null},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.504810Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:199e8ea57b43a77f767c8901c6a85a35fac2b9c3fa1578ca24c8b134c43db386","observation_id":"1409acd7-b18b-4d17-89d2-c1fcbf0d2329","resolution":{"observed_at":"2026-08-06T23:14:05.066511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:06.328014Z","title":null,"venue":null,"work_id":"9cebf2a0-7172-4abc-b27c-2e46b34e1c0d","year":null},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.663227Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:64383c38e8b759643d315a3f2ca1994bfe3adc29f65b976f4aa086ae527b7485","observation_id":"5127464a-b216-45f1-9214-9bdef6185004","resolution":{"observed_at":"2026-08-06T23:14:06.430275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:04.571622Z","title":null,"venue":null,"work_id":"5edfa9b3-8a92-4c76-8fa2-ce93985de217","year":2018},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.779183Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:3019fb34b851d5046caa02b667561a96b6b9da7f2ac26a70d1d708b629692983","observation_id":"024e4a3c-9eb5-4061-97b8-93d697c5b838","resolution":{"observed_at":"2026-08-06T23:14:04.768990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:04.310166Z","title":"Proof of Thoerem F .2.Step 1: Convergence of mean values toQ ∗ The proof mainly follows (Rowland et al., 2018) and (van Hasselt, 2010)","venue":null,"work_id":"b3dde1f1-1f04-4194-a3c3-0d66e911c0d6","year":2018},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:03.900092Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:249268b40bddde7bd35cd96eb48611e44586fb30a8be5507c6b212efb2113e49","observation_id":"b2b31dbe-d416-43cc-9c25-6f18bc953f76","resolution":{"observed_at":"2026-08-06T23:14:04.419404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:01.783734Z","title":"Sudakov, V","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:01.783734Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:5d46e0273aaf285f21a745bd66bfe1e308cd0c6efefd009cb5a5d2fc9fb397a9","observation_id":"28ac423a-4283-43a5-aae1-2130bf241611","resolution":{"observed_at":"2026-08-06T23:14:01.783734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-14T22:31:25.126692Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-06T23:14:02.096212Z","title":"cc/paper_files/paper/2010/file/ 091d584fced301b442654dd8c23b3fc9-Paper","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:02.096212Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:5fdb94324849ec8f87272b6820ea7631cc0983b0cba5856b71e30e1ef67237ae","observation_id":"fcf4708f-c7dd-42cc-9c50-92c62f4b8c95","resolution":{"observed_at":"2026-08-06T23:14:02.096212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-08-14T19:03:45.460809Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-08-06T23:14:01.517365Z","title":"Bellemare, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:01.517365Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:398b8118b752e472ea737272181da202932fce6eddd19731786ba919d152a83c","observation_id":"6d401963-943c-487c-829f-75d90edf13e9","resolution":{"observed_at":"2026-08-06T23:14:01.517365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13350","last_updated":"2020-03-30T11:33:16Z","snapshot_observed_at":"2026-08-19T17:08:38.315408Z","submitted_at":"2020-03-30T11:33:16Z","title":"Agent57: Outperforming the Atari Human Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13350","snapshot_observed_at":"2026-08-06T23:14:01.364990Z","title":"Badia, A., Piot, B., Kapturowski, S., Sprechmann, P., Vitvit- skyi, A., Guo, D., and Blundell, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:01.364990Z"},"links":{"cited_paper":"/paper/2003.13350","citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:466d05fdcec9878a5ee9d10c9dd6e716f08a9ca8ef81869d824da2782de22bcc","observation_id":"49fa3b95-c673-4957-a3a2-465b7f2aee64","resolution":{"observed_at":"2026-08-06T23:14:01.364990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:01.936257Z","title":"Thrun, S","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:01.936257Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:257d08342428ab01b5759c29876ae9072242886db35b870ee540e08e50a75cdd","observation_id":"bdd6cba9-744b-4471-890a-08812cefc87d","resolution":{"observed_at":"2026-08-06T23:14:01.936257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.04242","last_updated":"2018-07-02T18:49:35Z","snapshot_observed_at":"2026-08-14T19:05:00.764751Z","submitted_at":"2018-06-11T21:02:50Z","title":"The Potential of the Return Distribution for Exploration in RL","version":2},"cited_work":{"arxiv_id":"1806.04242","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.04242","snapshot_observed_at":"2026-08-06T23:14:04.099860Z","title":"The Potential of the Return Distribution for Exploration in RL","venue":"cs.LG","work_id":"27d7eeba-24e6-4b63-a3fb-70f71a164fc2","year":2018},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:01.663649Z"},"links":{"cited_paper":"/paper/1806.04242","citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:a28cd7d6b41c2d525ade1dc0e91eb4c1a68b41e40961ee1a223a9d7be0e01f50","observation_id":"81d9263f-6718-4c68-9b87-850c84d9562f","resolution":{"observed_at":"2026-08-06T23:14:04.164753Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:14:07.475277Z","title":"cc/paper_files/paper/2021/file/ f514cec81cb148559cf475e7426eed5e-Paper","venue":null,"work_id":"67e4cd0e-4e9a-4c16-9c43-b71d3ea1b792","year":2021},"citing_paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:14:01.264177Z"},"links":{"citing_paper":"/paper/2506.19478"},"observation_digest":"sha256:7143f3a3f82451bc71beb66c55a6524601fe97863cf3fba9faa671a30c803c8e","observation_id":"e8a5cf44-19f7-402b-9f16-9bc316766de8","resolution":{"observed_at":"2026-08-06T23:14:07.582196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19478","last_updated":"2025-06-24T10:09:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T11:12:54.344171Z","submitted_at":"2025-06-24T10:09:26Z","title":"ADDQ: Adaptive Distributional Double Q-Learning"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2506.19478."}