{"as_of":"2026-08-07T03:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a574916e4542b81490a5d9b4587be6f04769b88e44eaa0595bf67126522bcd7","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:01:47.191696Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09523/citation-record","integrity":"/paper/2507.09523/integrity","json":"/paper/2507.09523/citation-record.json","paper":"/paper/2507.09523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:44.735602Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:44.735602Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:209f807ec0d3ca0c09bb8e7f649aa6d006ed80671525da17f76b87ed7048e4d8","observation_id":"82aaab77-0338-46e0-bb06-92e787f30d06","resolution":{"observed_at":"2026-08-06T18:01:44.735602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:51.242433Z","title":null,"venue":null,"work_id":"cef9f66c-fa37-4a23-8f93-4af40eea2da9","year":1993},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:44.855222Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:5e9d440610a4323257413798f338c337242b24bb251c5389ba854acc8a64159f","observation_id":"a2eb5b45-b5dc-4f01-b32a-fa21b259404f","resolution":{"observed_at":"2026-08-06T18:01:51.426569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.999654Z","title":"Sur les op \\'e rations dans les ensembles abstraits et leur application aux \\'e quations int \\'e grales","venue":null,"work_id":"c752fe93-f1a1-4294-bb5f-1da9954f7875","year":1922},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:44.976043Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:70528772b8e11ac075d4cb8c79090f9f87c8ea95863885dac8f552e80385ceaa","observation_id":"49aac7d9-f0e4-4fd7-be52-3ff2dcc6abd5","resolution":{"observed_at":"2026-08-06T18:01:51.113175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:45.055174Z","title":"Dynamic Programming","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.055174Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:05d752270f912dc4cae9e590b61c18e60b0b0a30f2c7252e9ff26cdb87b9a64c","observation_id":"88c31345-0586-4a52-b1f5-a7038a19a76d","resolution":{"observed_at":"2026-08-06T18:01:45.055174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.855275Z","title":"Bertsekas and John N","venue":null,"work_id":"dfe70e5c-8c6a-4e1b-93ed-cc2e513df9fa","year":1996},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.192835Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:0d37ce5dbfa576dbe908546cc7b69e5cd06ad843b416f987504a488fffb21270","observation_id":"7450fe15-d8bf-428c-9bda-665639b9468a","resolution":{"observed_at":"2026-08-06T18:01:50.904931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.699085Z","title":"Multistep Credit Assignment in Deep Reinforcement Learning","venue":null,"work_id":"518d344f-f52a-4b9e-ac56-68b864826acc","year":2025},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.304714Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:4821717e90ab2ff39cfbe85edb97b47c9cf185709983baedd884c131705a8dab","observation_id":"fbe8b06b-4a0d-4413-a3e5-73037c103b4f","resolution":{"observed_at":"2026-08-06T18:01:50.775974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.554512Z","title":"ChainerRL : A deep reinforcement learning library","venue":null,"work_id":"013f6a2a-3b73-4d8d-95fe-1870a9a93d9d","year":2021},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.368932Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:17444b98dc5d2018602bfa12fcc72a5288b40865fb6a7a79a0c1b3467aa969f7","observation_id":"49119f6f-aff3-4fbb-8560-2f69162cbcff","resolution":{"observed_at":"2026-08-06T18:01:50.632827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.426739Z","title":null,"venue":null,"work_id":"0867f647-37e9-4517-9eb1-fe0aac8acbcd","year":1994},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.486551Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:47d2d83f2763f3b935d16a4022a50e8040702c7beddbc8630f345a8108d4feea","observation_id":"7dfa3418-b4fe-4d31-83b9-87ac0e446569","resolution":{"observed_at":"2026-08-06T18:01:50.491388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.304235Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"5126a846-d884-422c-b146-0501564cb60c","year":2015},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.604642Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:fedef8c19d8f69df5f1cff13e38ede97ea04b98bc03f8b7d1e3204f50bd398c5","observation_id":"d742ebfd-07fc-4337-90c9-25fd85e9f059","resolution":{"observed_at":"2026-08-06T18:01:50.360877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.132515Z","title":"Orr, and Klaus-Robert M \\\"u ller","venue":null,"work_id":"39dcc347-3527-431f-9848-c00e4640c060","year":2002},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.697423Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:0bec2bfd1c12fd4a5116f245306bf5a1e6a5e80c2dd3aca1061dac72b739058c","observation_id":"58a7a71b-afa8-4ac7-82b8-9c0fbb5dfb7a","resolution":{"observed_at":"2026-08-06T18:01:50.213833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:50.009121Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"528b05e7-786a-4960-8bfb-967613705f15","year":2015},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.818776Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:be6543856d9b18d70a66242d1b864736a714c0479628c332c6740be2039c4b85","observation_id":"9a3e49df-698b-4a37-8b30-74688ca8b8b5","resolution":{"observed_at":"2026-08-06T18:01:50.064504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02215","last_updated":"2023-11-03T20:03:54Z","snapshot_observed_at":"2026-08-06T06:17:48.145162Z","submitted_at":"2023-11-03T20:03:54Z","title":"Towards model-free RL algorithms that scale well with unstructured data","version":1},"cited_work":{"arxiv_id":"2311.02215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02215","snapshot_observed_at":"2026-08-06T18:01:47.394239Z","title":"Towards model-free RL algorithms that scale well with unstructured data","venue":"cs.LG","work_id":"2f458956-f2b9-4ab4-90d4-21dfc13654c6","year":2023},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:45.917099Z"},"links":{"cited_paper":"/paper/2311.02215","citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:580cdcbc87e70946c5bfb46e5a9e7ff44a6974a54a49e0f0cba6d5b7407ecbdf","observation_id":"c9259be3-76b0-4b10-a6a0-c393a0c51e4d","resolution":{"observed_at":"2026-08-06T18:01:47.519541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.876524Z","title":"Revisiting Rainbow : Promoting more insightful and inclusive deep reinforcement learning research","venue":null,"work_id":"2bf09cbc-5c5e-4780-a83f-4db3b063e65b","year":2021},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.020479Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:24b1e627cd25bce01d0ab08ad559d9ddd955aa434b0305edc18bf2c268797630","observation_id":"03ae75ac-1be6-466a-bae3-d767da002530","resolution":{"observed_at":"2026-08-06T18:01:49.937782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.781232Z","title":"Rummery and Mahesan Niranjan","venue":null,"work_id":"a95c0f89-b65f-4ab8-9d6d-3c66eea45849","year":1994},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.115279Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:df3c6d0973400f6b3e3602007a08fc7cb9709ebd10f3b3f31d0c4923a27f96ca","observation_id":"b6d1f872-1467-4ef7-83ea-07d58b4a3290","resolution":{"observed_at":"2026-08-06T18:01:49.834689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.645551Z","title":null,"venue":null,"work_id":"0f048e47-0786-4edf-b587-f9c344a2e79b","year":2020},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.207382Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:634c1dffadca3d82198c5ade57dd22d5629b24ba859c23d16c6459139acd6e4b","observation_id":"49ad9446-5ee9-4e3d-b989-db0a0616c173","resolution":{"observed_at":"2026-08-06T18:01:49.703269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.516559Z","title":"Littman, and Csaba Szepesv \\'a ri","venue":null,"work_id":"c59c6a9f-ebe3-40fb-ba1f-229f0fa7a2af","year":2000},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.290297Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:f5f2cd94983fbe1cefe3ce887b6ac1c0458adae7a55b54d4f8afe52a94f8b77f","observation_id":"8cff4409-b4e7-4c88-bd2e-fb44c043a8b3","resolution":{"observed_at":"2026-08-06T18:01:49.575152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.369548Z","title":null,"venue":null,"work_id":"2066588b-8b5f-43be-a7db-a86e11419691","year":1988},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.377144Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:abc68b50f4ae23abb9f5aacafa29bcb0298baa0927947577767fc637d8d9695f","observation_id":"58931b2f-9137-4d8e-a2c7-a1c07d8fb3ce","resolution":{"observed_at":"2026-08-06T18:01:49.427621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.227120Z","title":"Sutton and Andrew G","venue":null,"work_id":"1bcfb51e-d0cb-4a38-916b-6b106e48f514","year":2018},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.468196Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:8f60cef722c751bed733879b92d530e49fa96a92d6b853bfd8a9ecb046828eb3","observation_id":"90ab8c3d-19a9-4e2f-8f9d-8f470a925902","resolution":{"observed_at":"2026-08-06T18:01:49.289687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:49.067000Z","title":"VA-learning as a more efficient alternative to Q-learning","venue":null,"work_id":"c604dee0-e807-4cde-8ab4-4069dda9fc69","year":2023},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.563594Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:e16d528a4caee36c5c2bc5f0fc6a99bc8c4026836e8536cae538eafea6f75af4","observation_id":"380e6ba9-f74a-4281-accb-a82f3045e7c2","resolution":{"observed_at":"2026-08-06T18:01:49.135279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.925659Z","title":"Double Q-learning","venue":null,"work_id":"dede0e73-09f4-4276-a8aa-64133be1452f","year":2010},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.638334Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:374cedf782ef2ac2ad0505b171827542a57048127b88da6d3620deac68b3e082","observation_id":"41bad30e-a29f-44fd-993e-b5942ea11e2f","resolution":{"observed_at":"2026-08-06T18:01:48.994867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.761942Z","title":"Insights in Reinforcement Learning","venue":null,"work_id":"e07b4aec-0f7e-4ba3-96e9-1bf91c989783","year":2011},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.723290Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:7ca615fa2888a424f0b42baa1723a89c09975e966bd6d298ba0d681a2255fb43","observation_id":"2413f22d-5b75-47ec-b6f8-1940c20fd601","resolution":{"observed_at":"2026-08-06T18:01:48.840394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.645754Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":"d1ebb7ad-2a9f-4e8c-991a-cd15961d5d4d","year":2016},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.799484Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:afbb59e7b4d4e4b9fce659e9bbf3291006f8ad5850a69a2b5e88f188d82a24c9","observation_id":"344721d1-d006-4cd5-be36-51e75d1f6521","resolution":{"observed_at":"2026-08-06T18:01:48.710073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.494440Z","title":null,"venue":null,"work_id":"59bcf2bc-3fac-48d0-9a67-96559c54558c","year":1989},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.815493Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:6333e9119a4d03a7b66d2c55ee80ee5545d29e7631e19636fcce9f19690733aa","observation_id":"3bc160fe-f2bf-477d-8e61-9713e3fe5b9d","resolution":{"observed_at":"2026-08-06T18:01:48.572660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:48.265467Z","title":null,"venue":null,"work_id":"ebc68468-fba0-4e93-abb1-e502f0d281a5","year":2005},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.827140Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:51e44275d70a0fd5186624a05f86fa74e1c22079d9968ea91f4c58baac20b2f5","observation_id":"15cdb5f2-f4e9-43b5-91fa-fc55735cdd2f","resolution":{"observed_at":"2026-08-06T18:01:48.406295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:47.942361Z","title":"Wiering and Hado van Hasselt","venue":null,"work_id":"ffa6ae51-933e-42ad-a185-72e2d31074d6","year":2007},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:46.894642Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:f5f716f7d3373190b0193fa505adc3c22c2acbd56137b96c295c8e947fed99d6","observation_id":"a390f672-f32c-42d0-aa0d-86a298d88ebc","resolution":{"observed_at":"2026-08-06T18:01:48.101275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:01:47.655437Z","title":"Wiering and Hado van Hasselt","venue":null,"work_id":"16587cbe-034a-4de0-8352-0f2a9311c888","year":2009},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:47.067674Z"},"links":{"citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:f6d971f5c664fb7bc597116ec88b171b2c1e2a2e0c3cd1c616c8513b12804db3","observation_id":"d490c7c4-2992-4a36-8d87-4706443e9f22","resolution":{"observed_at":"2026-08-06T18:01:47.826751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-06T18:01:47.191696Z","title":"MinAtar : An Atari -inspired testbed for thorough and reproducible reinforcement learning experiments, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:01:47.191696Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2507.09523"},"observation_digest":"sha256:9423f96c8e800084bfebe0c270524ee15d7c6aa64ba9e14df884e5bbb134c161","observation_id":"85b62dba-ea0f-4746-a7cd-3f2f496889b6","resolution":{"observed_at":"2026-08-06T18:01:47.191696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09523","last_updated":"2025-09-04T06:03:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T17:51:15.398359Z","submitted_at":"2025-07-13T07:34:33Z","title":"An Analysis of Action-Value Temporal-Difference Methods That Learn State Values"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.09523."}