{"as_of":"2026-08-12T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b63074df0f09deedd793dd4ea46f93418a0a32a44f5fec8de12b9566a98843e","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:39:59.778081Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:25:38.157587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"cited_work":{"arxiv_id":"2606.21297","doi":"10.48550/arxiv.2606.21297","metadata_source":"pith","pith_arxiv_id":"2606.21297","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","venue":"cs.LG","work_id":"447099da-33ef-4fe6-8c73-26bf7962f78d","year":2026},"citing_paper":{"arxiv_id":"2608.06015","last_updated":"2026-08-06T13:19:29Z","snapshot_observed_at":"2026-08-11T07:49:29.964642Z","submitted_at":"2026-08-06T13:19:29Z","title":"ProDVI: Programmatic Dynamics Priors for Value Network Initialization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:38.157587Z"},"links":{"cited_paper":"/paper/2606.21297","citing_paper":"/paper/2608.06015"},"observation_digest":"sha256:99c96c533ac9ac0f5996d52e411a50a5dc20932c116a776ba2c4bdf103fff254","observation_id":"0f5a31f3-017b-48bf-9a5a-4e7962ce4f1c","resolution":{"observed_at":"2026-08-07T19:25:38.442865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.21297/citation-record","integrity":"/paper/2606.21297/integrity","json":"/paper/2606.21297/citation-record.json","paper":"/paper/2606.21297"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:e2b0f697b435ba8f0853a185e037006a38952efb93697e4ec3fbe6124bec260a","observation_id":"5f317c91-71b0-40a7-ab9f-9a970e2d1518","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/nature14236","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.004459Z","title":"Human-level control through deep reinforcement learning","venue":"Nature","work_id":"1ff30834-09de-4b27-9602-0bd5ea024dd0","year":2015},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:96c57b34c1caf2c9220101152a52fa6201569299b4bb1f7fb4966f21a69a28e1","observation_id":"a0d3fbe8-369a-4054-86f1-67e6a929692c","resolution":{"observed_at":"2026-06-26T14:49:32.407224Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-18T13:51:14.811373+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T13:51:14.811373+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:76595af536dd183a45bf34a1b7e26fcba790555dfc28ce3ab635cd55d1249b3c","observation_id":"d8689425-c486-4cf9-aca1-dd06a3717f56","resolution":{"observed_at":"2026-07-04T06:19:37.625838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:c133e3dda7a3801db13f414ab4bb90ca4c5127afdc8f89767ce43a3d4dc247a0","observation_id":"7983f709-9b14-42f0-9b66-39c18e85c3f3","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"URLhttp://proceedings.mlr.press/v80/fujimoto18a.html","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:3035f378baa4009ee9d71898c41e001ced59c5a6e5975d6f93cbad6393fffc05","observation_id":"be50982b-608b-4d1c-bcb1-f7387dd02a94","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Lillicrap, Jimmy Ba, and Mohammad Norouzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:313c1a00ef0a766d9c1581ee0e788331c04aa27a620995b89e25d02ce925fd92","observation_id":"2cedea32-7028-4c93-b2a7-caaee29a8014","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:78b48464ebe22498fac0a8b880ad01e5bfb814965fbc579cc9073bd40eef8ac9","observation_id":"2ac79882-3c57-4cfa-81d1-09b962c16e4f","resolution":{"observed_at":"2026-06-26T14:49:32.409840Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:456a8b177db41556c95aabf837bb80e2aa9827d62e453c93adad9e4bbd862731","observation_id":"9e1c918e-9b3f-4449-8019-7c8eb6290035","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"TD-MPC2: scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:b5f7d8081b308bfa331f4d6bd1ec895cbfd0071e1b40cd233c3d42e747a11ce3","observation_id":"cab8bb7a-a644-41ef-b3fe-61a3a37a1fc0","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08265","last_updated":"2020-02-21T18:05:30Z","snapshot_observed_at":"2026-07-06T08:38:07.984092Z","submitted_at":"2019-11-19T13:58:52Z","title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model","version":2},"cited_work":{"arxiv_id":"1911.08265","doi":"10.1038/s41586-020-03051-4","metadata_source":"doi_reference","pith_arxiv_id":"1911.08265","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model","venue":"cs.LG","work_id":"964ed935-1570-495e-a162-9182456934cc","year":2019},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/1911.08265","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:10b4e427dcbf6638387a91cffc1e446f6d78da1bdb6bcd088f0a7700551161f4","observation_id":"d762848a-12b6-45b7-b3ca-c60cffc899a8","resolution":{"observed_at":"2026-06-26T14:49:32.413823Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:38.761479+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:38.761479+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.775957","doi":"10.1109/iros.2016.7759578","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable reinforcement learning with autoencoders for tactile and visual data","venue":null,"work_id":"7553e107-abfe-4782-af0a-a11f9a10466e","year":2016},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:078537b1b7383c9aa355717ed8070f38e0d9ed7da64801e7b09a67bb16c94688","observation_id":"51591905-effb-41a2-a969-7b89c7156504","resolution":{"observed_at":"2026-06-26T14:49:32.430508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Decoupling dynamics and reward for transfer learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:04214b6a6505aed42b19fe98b62c1b5ae441cae87e95a02569bcfc92e3164da6","observation_id":"60ca205f-8503-408c-8794-e2fdb5edb566","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Bellemare","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:b45e01361682c8f4ab9548aa540e3da930f29cc7d198f32e45c593a4b326a39e","observation_id":"f584e372-1751-4173-928d-e2c29e7e249c","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Jha, Toshisada Mariyama, and Daniel Nikovski","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:bb8435e31d46e646ce1fae37b736fb0f6e521fe1b0beea5bb431cc3762e99b2c","observation_id":"2a896039-a8cd-4dcc-b3de-8ff12ace07f2","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:7f1c3f17fa88ee8894bfd3f9ed6a10571206e0e09a092fe794eb42c32aa31369","observation_id":"7099ecbf-4a99-40fd-bd70-e66041e3a368","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Bootstrap latent-predictive representations for multitask reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:2ef59243ca9cf8de32e1de4ebb297a0c8e81f89b6cab5270f8b408acd3249735","observation_id":"75dc07cf-ccef-40e9-8d4f-2f95001ce8d9","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Devon Hjelm, Aaron C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:122a30b72140746b9823cb642680756d61477487313c2b2791e3a2a0f56f2b5e","observation_id":"0810e75c-fb20-4721-9423-0c3e0bdedc8c","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"URLhttps://openreview.net/forum?id=uCQfPZwRaUu","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:b7e35591b1f84c9b6816dc4a23e7bbbc95f03be957b628fe0fa45a709897478b","observation_id":"a18538d6-d2fc-432c-a04b-030da0c899c7","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Smith, Shixiang Gu, Doina Precup, and David Meger","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:85034929f53ae9f5d3e2dadaeb7e39f297be12b3f17dcf9a872c3125d82d5d75","observation_id":"56bcb789-c91f-400d-aeec-0a16338bdfff","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Towards general-purpose model-free reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:2b6af1d2836425ac8d33a9f261abc44ed5669f5e7b0231a5f8b60c3b024a6563","observation_id":"7bd3d6f4-c10a-41f3-9174-fb88b820ce9c","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:c4f183e12035e7fd0474fd375d65fb51cdd71ef232add1224591d6159984692b","observation_id":"5e6401d3-d5f0-4d1a-81b7-dc2be5bb9b94","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:e25a95dbc81b7b7fc7e8fadfe342e2304c474cf4ede6a103f86178b67e95dbaa","observation_id":"2e20d636-adf6-4bd4-9e48-255d15caefe7","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T04:19:02.139595Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:6ac2947dfc1d59c92b9897dbfb7317188adf1f6d0f50a4cc12b4c4b8b615e632","observation_id":"f69f27f8-0109-4c9d-94be-6f7ed488a389","resolution":{"observed_at":"2026-07-04T06:19:37.633607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Gomes, and Kilian Q","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:3d185ce739ea22661184ff5b4e1e80cf2359bac3ed1b59983f868211d0ee03d3","observation_id":"f4769078-8a5e-44c0-9e16-c06db084e6b9","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Spectral normalisation for deep reinforcement learning: An optimisation perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:6036e6ae257502b53bfbdabb1c1b838a137aa28ebc1e948626782f73493618de","observation_id":"12312637-a44f-4785-b5ae-4be9ba5ee939","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5637.366297","doi":"10.5555/3635637.3662970","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Normaliza- tion enhances generalization in visual reinforcement learning","venue":null,"work_id":"35ca64d9-704d-44fa-8cd0-ff4ac4c18bbc","year":2024},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:ea568bfcf3a6ae48059582f14abc19cbbb26a1eb8feba28dc657a835c055f63a","observation_id":"e5ad6fa1-7c80-4d97-9115-433a0f76a642","resolution":{"observed_at":"2026-06-26T14:49:32.422512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Image augmentation is all you need: Regular- izing deep reinforcement learning from pixels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:c9f526bd7776953013dbea3f07de1010d59562822dd6a7cd3adae9c7ade3a002","observation_id":"c1ee5e32-4f32-4d38-981c-94a0cb97a9a6","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Mastering visual continu- ous control: Improved data-augmented reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:563b03792cf49af0c29ab396965d7fc150ac95bec421201345a90602a8e313a7","observation_id":"de6c538e-f278-41d9-bc83-a03dcefb9670","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Stable-baselines3: Reliable reinforcement learning implementations.J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:1706a5e939c2992dfeb92fdc9662e71c61bf15b575a296409e1d7abd22d25aef","observation_id":"b6acbbef-2764-4ca7-887f-f1232dbdddbd","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Bridging state and history representations: Understanding self-predictive RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:d53057d692cb8adceeb6196350a74a78c0fe424b7cd7b903ba902c2fba1f28f3","observation_id":"622075b8-7b93-45c7-af33-d1770de7bdf2","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"When does self-prediction help? understanding auxiliary tasks in reinforcement learning.RLJ, 4: 1567–1597, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:2b5cfe522410e5730add49f355a0da1015b74aa037ba23d070e0dedc67a767d9","observation_id":"a2d42450-a42c-4a3e-89ca-fa30ce881879","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:160a24d76cdf495755434b9cf9b69ef93258b7cc23ba2912452457d3ab126cdd","observation_id":"95ec457b-7db3-4286-bdc8-45f8c7a71231","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Balis, Gianluca De Cola, Tristan Deleu, Manuel Goulão, Andreas Kallinteris, Markus Krimmel, Arjun KG, Rodrigo Perez-Vicente, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:92ad4ae2d76e2f1c61befcd28b6c3610fc8be886cd79d4ef275ec48d86cc613d","observation_id":"7adb7113-0e16-4b3f-bff8-09e97adae3db","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:da2c4584bfc0b86f981b04a4ccb61236b536011517452f7e30931a794926e8a3","observation_id":"44155838-b25e-4acb-a51d-10ede4b4108b","resolution":{"observed_at":"2026-07-04T06:19:37.628282Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:19a6b0c268b7584868a2caec6b73fec896b983d2ebda6ea640cea56736fa1c96","observation_id":"84a96cdc-990e-4866-b683-c629c7c42091","resolution":{"observed_at":"2026-07-04T06:19:37.630932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11796","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rainbow: Combining Improvements in Deep Reinforcement Learning , booktitle =","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"65aaabb7-09de-4974-a2d7-ee0b516578a7","year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:7672fffabda4a74eb655edac3cd88ddf7bb743a3c7ca847e318482376dcda3b0","observation_id":"071d88f1-eded-41e6-82b6-328420f18bb9","resolution":{"observed_at":"2026-06-26T14:49:32.411582Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Robust estimation of a location parameter","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:910182d2e335f41f8d0ea07fb679b12d70aced4f8475bc39d84a8996bf54971d","observation_id":"3688046c-7490-455d-bc22-04cc85973582","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"An equivalence between loss functions and non-uniform sampling in experience replay","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:a8f44ec9cb3b0bfc7a9eae8194e97fc4da12f568282a5634f86e34eaf6e04348","observation_id":"c339a442-fc22-4ead-bd4c-eb7edef6a65a","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Ried- miller","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:fb33b7b11c46c73007bb3d0fe178eeba52f1d39f5c3a19f502083afd8221880b","observation_id":"b21413f5-0cd0-4580-8395-8088a950a018","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Gomes, and Kilian Q","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:974977393035bea4b7ebfb368426600e9fe7658b2fc2e4b3e00f7fe53709b77e","observation_id":"28f94e41-b9b7-4174-8c84-f488652a871f","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:c497d0f41fa13f5ba6c10c2b68a978abeea1e1bbb9b1d57473cdaa187dfed311","observation_id":"0fea252d-e049-48a9-b141-5d9fec2ac46e","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Discrete off-policy policy gradient using continuous relaxations.Unpublished","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:d1bc06cde986f79a2fb848ba27dec10158063844977e4299d288f195eaa4c3a9","observation_id":"f2e322c0-12de-4360-babf-36c21c9be447","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Bellemare, Yavar Naddaf, Joel Veness, and Michael Bowling","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:01b0db671839705d63bda54125951447168776a961c7c081738a0906ae6b5a75","observation_id":"ddd0e042-f6e3-47b4-b20e-e8f84cf56dd1","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:b52faff0f296e5dd4ca8a49f6aa0ccb79d14d076c39a41cfe4ac6761ad2efa10","observation_id":"acbd6fdf-f805-496b-a1a1-cb8dc53a7631","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2012.638610","doi":"10.1109/iros.2012.6386109","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mujoco: A physics en- gine for model-based control, in: 2012 IEEE/RSJ International Con- ference on Intelligent Robots and Systems, IEEE","venue":null,"work_id":"5f5e6f59-3edd-4ba3-9cc2-7e7483d4d151","year":2012},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:2de623c20358fc7dbee49abbca16dca9c3e2b3fc987b80191ca4b757e74a40ea","observation_id":"5a1548d1-08b3-48c1-a79c-59d42c78956d","resolution":{"observed_at":"2026-06-26T14:49:32.427750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:50:40.398486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:50:40.398486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Spectral normalization for generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:04d3dad0089513c482f0f3abc4cbc47376d3fffd7058738b5dc6a549ec0b4f5b","observation_id":"72437488-486d-46f5-8d05-29da19bc37b1","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:1a0c1920397306d7a2b8785c0f82c777cd79f7b7060ac0c9738b2a63efda0528","observation_id":"c1b9bb78-1254-4a8a-b3af-9744eea62d22","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"JAX: composable transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:b23250d0b41408a90074a11abb1f858b756568bab94d2d0df9cf8fb1d79ed70d","observation_id":"1a174d8b-c689-41a3-800c-befdff8f9d78","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Fast and accurate deep network learning by exponential linear units (elus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:0ef44aca87e44d025c3e66ab5a5521bb2f23e70c1d1bc5b5c9a94ee2c753f90a","observation_id":"310ac5da-b01e-46eb-ad1f-15f36e7a63e7","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:8b08c8fa95ab2193468d2d303da32a2331e07f599bb06eb1f52b6648625c460b","observation_id":"703738fe-1ce1-4ab0-b0e2-72bdfc00c7af","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:39:59.778081Z","title":"Deep sparse rectifier neural networks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:150cebe99cf3caa124d92fe2ad413def0fe6d1a66bc9ffe7232c26c0c3eb5ba3","observation_id":"b977c3a3-8490-4030-b852-1728b24c78b6","resolution":{"observed_at":"2026-06-26T14:39:59.778081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.06733","last_updated":"2020-10-21T19:19:02Z","snapshot_observed_at":"2026-08-10T17:19:33.952728Z","submitted_at":"2019-03-15T18:23:55Z","title":"Dying ReLU and Initialization: Theory and Numerical Examples","version":3},"cited_work":{"arxiv_id":"1903.06733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1903.06733","snapshot_observed_at":"2026-07-04T07:09:38.437806Z","title":"arXiv preprint arXiv:1903.06733 , year=","venue":null,"work_id":"60b28428-3738-4adc-bffb-4fef64cb3e8e","year":1903},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"cited_paper":"/paper/1903.06733","citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:c743ac42f5d3e3970f2b5a4585a8af5473998d42b2a3ff1980e6e6fb6fda536b","observation_id":"33f75801-431f-47ae-a5e9-74ad184df649","resolution":{"observed_at":"2026-07-04T06:19:37.636482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco.1989.1.4.541","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Backpropagation applied to handwritten zip code recognition","venue":"Neural Computation","work_id":"f12adc07-3a93-46d5-a446-3adbf2ab035c","year":1989},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:32ab4606de47d32cf866ce9f419fd684247feb02164a21095b93d548523a2c74","observation_id":"5224b758-6602-47de-9c78-c57758a2bede","resolution":{"observed_at":"2026-06-26T14:49:32.425002Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T12:49:59.900925+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T12:49:59.900925+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/5.726791","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:41.659007Z","title":"Gradient-based learning applied to document recognition","venue":"Proceedings of the IEEE","work_id":"0a3595ca-57f9-43f8-8e2f-aface7154b99","year":1998},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:2a0263e7b36382e966194e14f8bbdff38c619f5897d4273b45a642b77897098c","observation_id":"2f4399f8-fcfb-48f2-bceb-8ce79c2f1cae","resolution":{"observed_at":"2026-06-26T14:49:32.419739Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-03T17:38:16.714196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T17:38:16.714196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2010.553995","doi":"10.1109/cvpr.2010.5539957","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zeiler, Dilip Krishnan, Graham W","venue":null,"work_id":"38fc22c5-9c28-442e-951a-bda74f276248","year":2010},"citing_paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T14:39:59.778081Z"},"links":{"citing_paper":"/paper/2606.21297"},"observation_digest":"sha256:0e97b4e701321fd1895c5db482e5ca7db64a1230279628f945bc1702998b928f","observation_id":"2d3e7178-465e-409f-bce0-316b9ddc3f9d","resolution":{"observed_at":"2026-06-26T14:49:32.417551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.21297","last_updated":"2026-06-19T10:21:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T10:21:04Z","title":"NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":40,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2606.21297."}