{"as_of":"2026-08-07T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c6c59e64f58f0647af59fe6a1c5020b69f574bbf584528845b538bfd250af30","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:32:54.400821Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13672/citation-record","integrity":"/paper/2506.13672/integrity","json":"/paper/2506.13672/citation-record.json","paper":"/paper/2506.13672"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.188405Z","title":null,"venue":null,"work_id":"bf4d1474-3a62-4f2d-8f49-33146205c0f0","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.034330Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3c175c3a4d0d5cd6c66f03525d35e44c73860bb3c8dbb73a04f93af6307b0a3f","observation_id":"088c0f74-fe5f-4416-898a-0d8fa0a6237d","resolution":{"observed_at":"2026-08-07T00:32:56.191659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.178988Z","title":null,"venue":null,"work_id":"1cfb89c5-5d0e-4e23-a9c1-fc5185b15fa7","year":1985},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.070341Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2f29a294e1b37cb80020db176d6affc178290c0e4d26c64d0b31c6218e1fd692","observation_id":"d8740eef-1ef0-4a05-a088-89479bf979f8","resolution":{"observed_at":"2026-08-07T00:32:56.182111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T00:32:50.109869Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.109869Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:1bf44f846376006cebfa3772ae7892f075bc610416860cca84a3d95317410fdb","observation_id":"ba96e2ff-57cd-4c4e-be56-0657917e6209","resolution":{"observed_at":"2026-08-07T00:32:50.109869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.169011Z","title":null,"venue":null,"work_id":"692c29ff-e828-4925-a7c3-f9a7de55c24f","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.173653Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4710e906de7458f3786ae3c9df8fe54be370434814775e987c09f9e59579a54e","observation_id":"c78b0f73-f7eb-439d-9fa3-82d439d71346","resolution":{"observed_at":"2026-08-07T00:32:56.172292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.158460Z","title":null,"venue":null,"work_id":"45978843-6d80-4ceb-b815-c1b6c59efbc0","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.232671Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:8ad08e853bc9b758567335131616b3ea8d561c831350748e41625b37a0715910","observation_id":"94e30e18-13d6-4818-b1e4-163f389d09a6","resolution":{"observed_at":"2026-08-07T00:32:56.161746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.148786Z","title":null,"venue":null,"work_id":"16cf4a1d-809b-458a-ac4b-e6151c6a0d5d","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.284609Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:91f6e83352bd392408bbb1999daf5bd9c9f4fb2d972d24a96e77906a7e40cefc","observation_id":"a084e66b-bf25-4ca5-b7ef-e03e92b9180e","resolution":{"observed_at":"2026-08-07T00:32:56.151864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00986","last_updated":"2022-07-03T08:52:40Z","snapshot_observed_at":"2026-07-06T13:27:14.879012Z","submitted_at":"2022-07-03T08:52:40Z","title":"Stabilizing Off-Policy Deep Reinforcement Learning from Pixels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00986","snapshot_observed_at":"2026-08-07T00:32:50.368740Z","title":"J., Roberts, S., and Celiktutan, O","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.368740Z"},"links":{"cited_paper":"/paper/2207.00986","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:34f2e21c4b568b24f82373fb64e15e80f8500d14094fd8e005e2040f57e05248","observation_id":"ac4175c7-aa18-49a8-8509-72ac5a37170c","resolution":{"observed_at":"2026-08-07T00:32:50.368740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-07T00:32:50.412668Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.412668Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e81ba092603bb8e06b35616dd46413db825fc556caf4e819a1ba9fbd9a2e14d6","observation_id":"b58b6687-ec6e-4d18-b8aa-6fc75da5b71c","resolution":{"observed_at":"2026-08-07T00:32:50.412668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05056","last_updated":"2022-08-16T17:01:57Z","snapshot_observed_at":"2026-07-06T13:40:27.644738Z","submitted_at":"2022-08-09T22:00:28Z","title":"Model-Free Generative Replay for Lifelong Reinforcement Learning: Application to Starcraft-2","version":2},"cited_work":{"arxiv_id":"2208.05056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.05056","snapshot_observed_at":"2026-08-07T00:32:55.769785Z","title":"Model-Free Generative Replay for Lifelong Reinforcement Learning: Application to Starcraft-2","venue":"cs.LG","work_id":"63b69e19-e646-44df-a480-8860ca9d2203","year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.489700Z"},"links":{"cited_paper":"/paper/2208.05056","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:0883a72407e62dd4ef41aed2798b3a72312c005d15ce824355da5af2c14001ae","observation_id":"47f52821-2c7f-4b10-a141-14f7bd75a73f","resolution":{"observed_at":"2026-08-07T00:32:55.773730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0209900","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:54.854086Z","title":null,"venue":null,"work_id":"9d50dc75-b7d6-46ed-8dfa-ac665dd413fe","year":2019},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.552848Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:cc359d1a5c3bf2d846646f64b5999b97c5a576348ba299673ee00f4900093523","observation_id":"134041a6-9e97-48bb-8d6f-ba2341c7ff5f","resolution":{"observed_at":"2026-08-07T00:32:54.925914Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.592830Z","title":"G., and Courville, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.592830Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:08d4d0beabd1a31bdabe70ee1717971585cb5e8adf72c026262888953e262e52","observation_id":"a8db4646-1acd-404e-87ea-702597f337cb","resolution":{"observed_at":"2026-08-07T00:32:50.592830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"file/2640539","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.753541Z","title":"W., Subramanian, J., and Ghassemi, M","venue":null,"work_id":"43471407-37ec-4fcc-a7e3-91c0ada9d721","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.628887Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:d8717fe5433f774e92e6f39de323cdc539f5efec7824181dcb6f89f4b6ab8a0b","observation_id":"74eb255d-4dae-4ba4-9b9c-1872bf0fcfcd","resolution":{"observed_at":"2026-08-07T00:32:55.758573Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.703013Z","title":"Revisiting fundamentals of experience replay","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.703013Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:d5230470283fdc7b902d3add923e718b5f860711caacf42da2d5d8b502f660fc","observation_id":"67b3ad1d-71b8-4f47-973f-7ce034d107c7","resolution":{"observed_at":"2026-08-07T00:32:50.703013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.764866Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.764866Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:be3d0ac03eb5c1520f13572f317b622eb6ac4d70d7d4f752199781ceb9bb3f33","observation_id":"b23c158e-46a9-4aa9-b942-a735050d9861","resolution":{"observed_at":"2026-08-07T00:32:50.764866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:50.832637Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.832637Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3b725f9a10a09477f576a894153c76deb9014d28eee0e39e3e44a583be41df59","observation_id":"c08bb5d9-d454-446f-b43f-21835d58dad6","resolution":{"observed_at":"2026-08-07T00:32:50.832637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.joep.2016.12.001","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:54.665801Z","title":"Sunk-cost fallacy and cognitive ability in individual decision-making","venue":null,"work_id":"9efefa53-229f-4bf6-9749-efcf7dc7841b","year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.905906Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:9b12fab44aa0beca4a7c423742e32321216fd2da6c89d8a4395663e1fd875ceb","observation_id":"61054b92-983b-4b0b-831e-0dc697467c82","resolution":{"observed_at":"2026-08-07T00:32:54.706719Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.113352Z","title":"R., Millman, K","venue":null,"work_id":"890d34b3-a8fc-4485-92d4-29645dfd98ff","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:50.926428Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:b1244380583dc28117bcf3efd0e6fb3365def9bf02923a0766b84cf9176fe0ce","observation_id":"234a0dae-0fd4-42b5-a57c-451e32a7c932","resolution":{"observed_at":"2026-08-07T00:32:56.116543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.104558Z","title":"Double q-learning","venue":null,"work_id":"8650944d-c301-491d-9b3d-9f4ffb0410c3","year":2010},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.025987Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:55f67e1bc86d255bb5400800a64a9c87fb103cb7e1c7cf339380d05917fbf798","observation_id":"cf7f6777-c012-435d-ab6e-bb8e2237927d","resolution":{"observed_at":"2026-08-07T00:32:56.107696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-05T04:34:26.284207Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-07T00:32:51.089069Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.089069Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:9edce17f669649ca5fe24ff49195d8e0394bfa8771c6ba66cb6eb095af04ba7e","observation_id":"962346cb-77aa-4e31-a6e4-c439b653c794","resolution":{"observed_at":"2026-08-07T00:32:51.089069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13002","last_updated":"2023-03-23T02:51:50Z","snapshot_observed_at":"2026-08-01T18:35:39.892988Z","submitted_at":"2023-03-23T02:51:50Z","title":"Planning Goals for Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13002","snapshot_observed_at":"2026-08-07T00:32:51.133496Z","title":"S., Chang, R., Rybkin, O., and Jayaraman, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.133496Z"},"links":{"cited_paper":"/paper/2303.13002","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4b3f6ac107f781d26cce4fce9d9b26b5bf4ae4b0f533c43837d3881ab69fe489","observation_id":"30c170d8-8f14-4a6c-8741-82a3045d317f","resolution":{"observed_at":"2026-08-07T00:32:51.133496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08245","last_updated":"2017-05-29T14:24:08Z","snapshot_observed_at":"2026-07-06T05:43:52.691426Z","submitted_at":"2017-05-23T13:36:00Z","title":"Enhanced Experience Replay Generation for Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08245","snapshot_observed_at":"2026-08-07T00:32:51.201826Z","title":"Enhanced experience replay generation for efficient reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.201826Z"},"links":{"cited_paper":"/paper/1705.08245","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:5e27d9f042629dc025b3e0f95621ee3daf93fd61372f4dd4a1bd758bc362bbd3","observation_id":"0b6767b6-f2ed-4dfd-8933-e080872a10b3","resolution":{"observed_at":"2026-08-07T00:32:51.201826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.095260Z","title":null,"venue":null,"work_id":"9a3f4872-23b0-4bd9-8219-bc0704338e84","year":2007},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.236555Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:a4172ffd405449e4b095d7fee49ef1d8b2cbe68c8f1ded539a5786b8d42bf6ec","observation_id":"a7febbd2-a0e6-47f6-8055-a046938b0574","resolution":{"observed_at":"2026-08-07T00:32:56.098144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.086206Z","title":"An investigation of generative replay in deep reinforcement learning","venue":null,"work_id":"05c2f9ac-9e49-414f-8891-1eb9738543b6","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.264341Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:24a28da94b8ee113460df76457bec99702406e235e81d7b588a7fdac7dcae97d","observation_id":"a28efe13-186d-491b-926d-7db7514d8bb1","resolution":{"observed_at":"2026-08-07T00:32:56.089516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05664","last_updated":"2023-01-30T16:08:48Z","snapshot_observed_at":"2026-07-06T14:41:10.087407Z","submitted_at":"2023-01-13T17:01:58Z","title":"Risk Sensitive Dead-end Identification in Safety-Critical Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2301.05664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.05664","snapshot_observed_at":"2026-08-07T00:32:55.631685Z","title":"Risk Sensitive Dead-end Identification in Safety-Critical Offline Reinforcement Learning","venue":"cs.LG","work_id":"324d0a4b-3824-41c4-920c-9a37b510c3b3","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.310272Z"},"links":{"cited_paper":"/paper/2301.05664","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:94124ffa60246fd420caf39e9ae936ffe81b24e5cf78ec100f7723ab81a0cbf0","observation_id":"f8429033-e01f-4244-9be0-55bba015ae5e","resolution":{"observed_at":"2026-08-07T00:32:55.635890Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:32:51.372728Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.372728Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:812456ea900a62cc2d6bde9931ce4f97217c84459e433bc4764bad688937af4d","observation_id":"f931b24d-da63-42ea-8c8b-e07459ba2322","resolution":{"observed_at":"2026-08-07T00:32:51.372728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.075254Z","title":"CURL : Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"eabcaeef-1717-43e6-a051-2969b1a8839e","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.422423Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3080b3254cce3e45fa9f325c72602a4707b37b4edceeac6af6b55103bac8efa3","observation_id":"7f149a22-56a5-47e0-b243-32fd713826ff","resolution":{"observed_at":"2026-08-07T00:32:56.080060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05490","last_updated":"2022-03-16T08:15:15Z","snapshot_observed_at":"2026-07-06T11:46:43.815468Z","submitted_at":"2021-09-12T11:26:27Z","title":"HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05490","snapshot_observed_at":"2026-08-07T00:32:51.484896Z","title":"Hyar: Addressing discrete-continuous action reinforcement learning via hybrid action representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.484896Z"},"links":{"cited_paper":"/paper/2109.05490","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:6c64a2174130e304d22ec1f0a06e4c9704406f050d79cac50ae54c1c8e2c8afc","observation_id":"4eba7925-a8d6-498a-bb0c-2245d0a24203","resolution":{"observed_at":"2026-08-07T00:32:51.484896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T00:32:51.581844Z","title":"P., Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.581844Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:26cf398262e08f4352d6a52686010b4ca87b9ba60a6f77a8ac7918539de8d42b","observation_id":"9027ad0e-f8f2-4657-a7be-1ecfbd57f57a","resolution":{"observed_at":"2026-08-07T00:32:51.581844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.065910Z","title":"Unlock the intermittent control ability of model free reinforcement learning","venue":null,"work_id":"4d3d63de-6508-4e36-8159-23b8c7903101","year":null},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.627229Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:395e3ef6497577daa71f34d9b0cb7819b9ad1f31b0a2c26939b9beadccc5bbd6","observation_id":"8ca1f07c-c3b9-4933-8c83-ec8274f9d30f","resolution":{"observed_at":"2026-08-07T00:32:56.069185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.056641Z","title":null,"venue":null,"work_id":"e5da36ac-9e6f-41ac-b56e-2c784b603d4d","year":2025},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.676803Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:5fdabb51e4649bb8a7bf6d1c518a2885e6025c910afe01585b3b1836be58b024","observation_id":"66a22057-2102-44d2-91ba-467c9ce178c7","resolution":{"observed_at":"2026-08-07T00:32:56.060067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.046531Z","title":"W., and Parker-Holder, J","venue":null,"work_id":"0769f8df-7b80-4e67-becd-583ab226c080","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.718788Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2ca290e94868f18d734476bb8db697e580bc1e9f9ecf54c15b5c86de8b230b98","observation_id":"777ddf33-8dd3-45f6-841b-b27fa644f0c7","resolution":{"observed_at":"2026-08-07T00:32:56.049548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07418","last_updated":"2024-05-19T19:04:31Z","snapshot_observed_at":"2026-08-05T20:04:39.463011Z","submitted_at":"2023-10-11T12:05:34Z","title":"Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07418","snapshot_observed_at":"2026-08-07T00:32:51.760568Z","title":"Revisiting plasticity in visual reinforcement learning: Data, modules and training stages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.760568Z"},"links":{"cited_paper":"/paper/2310.07418","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:ad7ccf04818d483b8d4e815ace88dc23f9e769b75c54b84b47195ac47669be79","observation_id":"5a3c5aca-0cec-4191-a7ba-ccd0c65ce5ea","resolution":{"observed_at":"2026-08-07T00:32:51.760568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.036528Z","title":"Online reinforcement learning with uncertain episode lengths","venue":null,"work_id":"eacd50fa-27c6-4e2e-9118-fb04be411d94","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.823709Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:1df6e76121cd9f54d4334d16837f6494aaeed9ddb9e2b0fd996c2215728a6fda","observation_id":"914aae6e-5090-4352-802d-356c8f4d15ef","resolution":{"observed_at":"2026-08-07T00:32:56.040234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.025781Z","title":"Tactical optimism and pessimism for deep reinforcement learning","venue":null,"work_id":"53868f1a-e39f-4e0c-bc17-390896026709","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.877004Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4a706e5e4793c60a7fb4a7beb2b0947198355b11d5e918b3614f1a5e58d20ac1","observation_id":"1bada11b-e190-455f-b112-7defdb9beb3d","resolution":{"observed_at":"2026-08-07T00:32:56.029700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-07T12:11:17.938787Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-07T00:32:51.919314Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.919314Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e2b55d8d1132d0349306ada6dfb778558c4bd9e4f7fcb559bf7a413da8247314","observation_id":"0d1d9e27-5aed-4b82-a953-88d50f1a3aeb","resolution":{"observed_at":"2026-08-07T00:32:51.919314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.013196Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"a94c0e68-f3fa-4209-a047-c87c2d825f8d","year":2022},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:51.968328Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4f1d34610a94d0a08791f2fdc0b6741b407cf5d4acab9304879ce8e623ea2ca2","observation_id":"070c5cfe-e979-4beb-bcc9-a55dbd64ec20","resolution":{"observed_at":"2026-08-07T00:32:56.016950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:56.000911Z","title":null,"venue":null,"work_id":"98027dd0-8e15-4029-ab27-15ee67a3253a","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.017309Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:bbc9a84f34eaa663d61231c33a9c645e3205857ad363e442efa2723da2ae6be4","observation_id":"e8eb03d9-2105-45a2-bbaa-990e2397a778","resolution":{"observed_at":"2026-08-07T00:32:56.004767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.988772Z","title":null,"venue":null,"work_id":"5af7ddc0-7e25-42e0-a7ce-d15925b670b6","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.051990Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:9ae34702b785b91b0c3ec989ceba8ae4a84339243bbd57429362865e5c689b83","observation_id":"c0fc6932-682d-482a-bfc2-4920c266cc36","resolution":{"observed_at":"2026-08-07T00:32:55.992729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:52.099844Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.099844Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2b03161c95e15bcc771eaf93af55b2c8db7473940c092da859c3f091bec2a444","observation_id":"8668d5d8-ef85-4d7b-8892-2c64c2f76568","resolution":{"observed_at":"2026-08-07T00:32:52.099844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05926","last_updated":"2019-09-08T07:41:39Z","snapshot_observed_at":"2026-07-06T07:39:13.754069Z","submitted_at":"2019-03-14T11:54:13Z","title":"Reinforcement Learning with Dynamic Boltzmann Softmax Updates","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05926","snapshot_observed_at":"2026-08-07T00:32:52.160250Z","title":"Reinforcement learning with dynamic boltzmann softmax updates","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.160250Z"},"links":{"cited_paper":"/paper/1903.05926","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:00981fe95a68dbb39edf091f4c716b607a39d3141e0cc4e8efb906c770f575d9","observation_id":"65a0b996-78b1-4ed1-a3ea-e92db6cdf013","resolution":{"observed_at":"2026-08-07T00:32:52.160250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.977911Z","title":"Softmax deep double deterministic policy gradients","venue":null,"work_id":"c3a5c701-8adf-42a0-84bc-ce433ac5f55f","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.192637Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:25857e70d2f70f02f66591cd2b8823e9042818a7906950261a166ba9c5b87b07","observation_id":"9660b867-6b68-419b-88d0-fd77ae2cf9f2","resolution":{"observed_at":"2026-08-07T00:32:55.981193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.966761Z","title":"Regularized softmax deep multi-agent q-learning","venue":null,"work_id":"dc99177d-11cc-499a-957c-951a3e3fc7fa","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.230814Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:7fdb33749003508d834e6eb41ab15cae8c9715ebd561eef783c42bd4712b420b","observation_id":"fd8f489c-b566-440a-88c7-cf0253156be3","resolution":{"observed_at":"2026-08-07T00:32:55.970541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.954966Z","title":"Time limits in reinforcement learning","venue":null,"work_id":"36df8e9d-2a6e-46e8-b832-9ed00c57e4d8","year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.321621Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:6516f1e45273c719bd3f4ea692139d8aa9b3426e68963e7eda2a9fe4180f52e4","observation_id":"5c1641d6-a350-4942-84a0-4fc0f58aa313","resolution":{"observed_at":"2026-08-07T00:32:55.958785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.942921Z","title":"A., and Darrell, T","venue":null,"work_id":"226c33e0-5f5d-4092-b57f-a5eaedddd21a","year":2017},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.386837Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:bda5c9a41b18cbb3cf1d273b2f7f2d2550e06cde71f95a6255dde853b599b67d","observation_id":"a39b91ca-6935-48b4-a1b8-47d17ec83dd5","resolution":{"observed_at":"2026-08-07T00:32:55.947216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.930270Z","title":"M., and Restelli, M","venue":null,"work_id":"8009ac41-9e9a-4901-ae0b-a63945cb8038","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.430420Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:2422066db90cf7b5c2a3a77aef6dcd76941221b96320956e80942eaaef021517","observation_id":"2986c97b-8c8d-4f18-b235-2c43b089d4f4","resolution":{"observed_at":"2026-08-07T00:32:55.934747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.917234Z","title":"M., and Restelli, M","venue":null,"work_id":"d609fa02-505d-4c72-bdd6-ed3abe4bd035","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.493835Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:a905acb1f92f246d178ca31da74bebe3a6ce49e53d0c601264236f53801a9674","observation_id":"42e3395c-bc25-4354-8cb0-42c32b25495c","resolution":{"observed_at":"2026-08-07T00:32:55.921337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12174","last_updated":"2020-02-26T17:15:53Z","snapshot_observed_at":"2026-08-04T14:27:36.843697Z","submitted_at":"2020-02-26T17:15:53Z","title":"Optimistic Exploration even with a Pessimistic Initialisation","version":1},"cited_work":{"arxiv_id":"2002.12174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.12174","snapshot_observed_at":"2026-08-07T00:32:55.551567Z","title":"Optimistic Exploration even with a Pessimistic Initialisation","venue":"cs.LG","work_id":"b83ea9e0-b8cb-4011-a6de-2db080e9984a","year":2020},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.586211Z"},"links":{"cited_paper":"/paper/2002.12174","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:fb571ea1aa9df7deaee1fe26820cad4697104637d836cf2b8daddd80096a9d4a","observation_id":"ac7e3916-194d-49ab-9420-f5302e4f0da4","resolution":{"observed_at":"2026-08-07T00:32:55.555362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T00:32:52.629886Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.629886Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:78231036b60fecfc6c2ad1abd4d11ca05b9ac547b502364e0ad9d310b5d54c88","observation_id":"b7cee4a3-ece9-4414-85ac-3e7ec8f782a7","resolution":{"observed_at":"2026-08-07T00:32:52.629886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.904364Z","title":null,"venue":null,"work_id":"754aea82-0a2d-4bfa-ba8d-260a47706983","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.697565Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:f449396e7446c426ec31bd9e5c273972abe02b522f6ab166703c3edc55236fce","observation_id":"0e458a88-e4c5-4099-9924-1a5abfd97568","resolution":{"observed_at":"2026-08-07T00:32:55.908081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:52.837429Z","title":"S., and Evci, U","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.837429Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4a942daa99da6f2cb4ac299ee87e923834ac8ba230f5e8cc49299dd5af77ef2b","observation_id":"e9e3441b-e682-48b6-9f1b-4ea00bcb32b4","resolution":{"observed_at":"2026-08-07T00:32:52.837429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01930","last_updated":"2025-02-26T20:36:25Z","snapshot_observed_at":"2026-07-06T19:26:33.330434Z","submitted_at":"2024-10-02T18:22:45Z","title":"Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL","version":2},"cited_work":{"arxiv_id":"2410.01930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01930","snapshot_observed_at":"2026-08-07T00:32:55.416658Z","title":"Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL","venue":"cs.LG","work_id":"ee58dc12-534f-4a1d-bcb4-53440e759128","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.902691Z"},"links":{"cited_paper":"/paper/2410.01930","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:62e4ab8c82e3e446175759a9d5e76dfd61e52fc4affe4dd0818cb36b49cd1147","observation_id":"6a35abc8-8d00-4b36-893e-a38fb2906a11","resolution":{"observed_at":"2026-08-07T00:32:55.490510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.883206Z","title":"Revisiting the softmax bellman operator: New benefits and new perspective","venue":null,"work_id":"05374d64-c563-4b9a-8c36-e0f260994786","year":2019},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:52.972733Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:e91f50febf9aa63c16f2b11cecad5ae0fdaa58ace992eebc20054c480f4f5266","observation_id":"f4ab1462-9de7-4f2a-8679-bc0723435502","resolution":{"observed_at":"2026-08-07T00:32:55.886519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.873179Z","title":"Prioritizing samples in reinforcement learning with reducible loss","venue":null,"work_id":"e0be0e66-dcb1-41a6-bde0-3e56fed17623","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.084002Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:cbe588e56f3c98c9cf25840e576697db960123ba65b7dafba04e94e764dd42ac","observation_id":"d90db58a-4793-4d0b-9c9c-9099759ce176","resolution":{"observed_at":"2026-08-07T00:32:55.876288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04200","last_updated":"2021-07-09T04:24:40Z","snapshot_observed_at":"2026-07-06T11:27:31.181558Z","submitted_at":"2021-07-09T04:24:40Z","title":"Safe Exploration by Solving Early Terminated MDP","version":1},"cited_work":{"arxiv_id":"2107.04200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.04200","snapshot_observed_at":"2026-08-07T00:32:55.251044Z","title":"Safe Exploration by Solving Early Terminated MDP","venue":"cs.LG","work_id":"d609d197-6cda-4dd9-a673-36c388c6560e","year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.197634Z"},"links":{"cited_paper":"/paper/2107.04200","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:d23404fc75a7fd70c165be71e69fbe9c0275b77ccded6b0b1a23e56c5be04aae","observation_id":"e6907165-b461-4f4a-ad31-8153b8e506b7","resolution":{"observed_at":"2026-08-07T00:32:55.325475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.aar8644","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:54.497626Z","title":"sunk costs","venue":null,"work_id":"18bc1943-8a80-4407-895d-24edb3fe8337","year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.278813Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:0d7546cbd657c5878599b7357b7434fad0662977db76c8f54f804d62364ae809","observation_id":"35d61335-ae2b-479d-abab-982bc9a399e0","resolution":{"observed_at":"2026-08-07T00:32:54.587105Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:32:53.351761Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.351761Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:5d606b648f8cc1f6e7a7e8b89930afec0aeb4acdef1acead806dfbf51191183d","observation_id":"364092c5-6388-4b31-afdc-14272e675950","resolution":{"observed_at":"2026-08-07T00:32:53.351761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02694","last_updated":"2025-04-14T00:48:47Z","snapshot_observed_at":"2026-07-06T15:50:53.355649Z","submitted_at":"2023-07-05T23:53:55Z","title":"Loss Functions and Metrics in Deep Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02694","snapshot_observed_at":"2026-08-07T00:32:53.432291Z","title":"M., Ramirez-Pedraza, A., Chavez-Urbiola, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.432291Z"},"links":{"cited_paper":"/paper/2307.02694","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:94daaec3bf2acd5db43a5f7453b53e3fee1f2f054b7c1d6bc1a328e89aeda0e9","observation_id":"6e83b4c8-5af9-4201-9939-05fa456612a6","resolution":{"observed_at":"2026-08-07T00:32:53.432291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.863753Z","title":"H., Meyers, E","venue":null,"work_id":"5202cc07-b581-4238-869d-7306c4979ae1","year":2019},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.623704Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3ef8c01fc1cc722215d27dd9088ef15d1660eda8ccfbfd0ba5e93bc091db9dc1","observation_id":"388bbcb7-8741-43ce-a4a1-fe19799cd702","resolution":{"observed_at":"2026-08-07T00:32:55.866665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.854057Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"443239ac-89f8-4cf2-9263-e25520d29d85","year":2016},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.697176Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:531de39cf37817a19a09caa360be4671db0ce6ee33e1fc6e27096f6b8056dea7","observation_id":"31640fed-96f4-4f9b-9cd6-58fb38c952ce","resolution":{"observed_at":"2026-08-07T00:32:55.857507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.843512Z","title":"and Drake Jr, F","venue":null,"work_id":"bec080d3-8f8b-4406-a8e2-8a68289ce652","year":1995},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.713465Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:f3488c17aaf7d9cb1cd87cee3ac83d0c98b2971019d71740307112ae4c1bab66","observation_id":"58976586-1628-4cf5-a242-d26288add4d0","resolution":{"observed_at":"2026-08-07T00:32:55.847097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04136","last_updated":"2019-12-09T15:47:27Z","snapshot_observed_at":"2026-07-06T08:43:06.269882Z","submitted_at":"2019-12-09T15:47:27Z","title":"Optimism in Reinforcement Learning with Generalized Linear Function Approximation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04136","snapshot_observed_at":"2026-08-07T00:32:53.761065Z","title":"S., and Krishnamurthy, A","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.761065Z"},"links":{"cited_paper":"/paper/1912.04136","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:6296bea123261b991c5c6110b9a75c74bc2794a43a87ea1ae60c23e5e6e8f3f0","observation_id":"cc25d49c-21eb-4831-96f8-e5b9a1915127","resolution":{"observed_at":"2026-08-07T00:32:53.761065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19668","last_updated":"2024-02-14T03:56:25Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T15:50:56Z","title":"DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19668","snapshot_observed_at":"2026-08-07T00:32:53.901414Z","title":"Drm: Mastering visual reinforcement learning through dormant ratio minimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.901414Z"},"links":{"cited_paper":"/paper/2310.19668","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:8f44cfa54853cc45566ef3b81660394f157ee76f1a30f8cab458f5774709d546","observation_id":"0f10747d-6b07-4af0-b75b-552092ec3032","resolution":{"observed_at":"2026-08-07T00:32:53.901414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-07-06T11:30:56.150751Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-08-07T00:32:53.985431Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.985431Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:9777f783b7014b5745dec0b01d717345f2531eedfd9c366ccc4cc74bf8a6b11f","observation_id":"c727a42e-9e6c-4af3-97cf-7fda9d49554c","resolution":{"observed_at":"2026-08-07T00:32:53.985431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12579","last_updated":"2023-07-03T04:36:44Z","snapshot_observed_at":"2026-07-06T14:45:52.127467Z","submitted_at":"2023-01-29T23:17:26Z","title":"Sample Efficient Deep Reinforcement Learning via Local Planning","version":2},"cited_work":{"arxiv_id":"2301.12579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12579","snapshot_observed_at":"2026-08-07T00:32:55.022274Z","title":"Sample Efficient Deep Reinforcement Learning via Local Planning","venue":"cs.LG","work_id":"14528dbb-37df-453f-93de-68bb5539129d","year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.102945Z"},"links":{"cited_paper":"/paper/2301.12579","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:67e0ac869c108115064dd086a263632751d8a20d2371aac81edd2437a9e91647","observation_id":"a72e8898-159d-41b9-a619-b35c1687e2dc","resolution":{"observed_at":"2026-08-07T00:32:55.136783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-05T16:16:51.134330Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11550","snapshot_observed_at":"2026-08-07T00:32:54.190932Z","title":"Scaling robot learning with semantically imagined experience","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.190932Z"},"links":{"cited_paper":"/paper/2302.11550","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:5c7eb48f4f9d26494860d4a713c9eda29cd9f4a96d61d38de7f262be0ba47b0c","observation_id":"0475043e-986d-4206-bde3-a48ea046d7fb","resolution":{"observed_at":"2026-08-07T00:32:54.190932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:55.831373Z","title":"Taco: Temporal latent action-driven contrastive loss for visual reinforcement learning","venue":null,"work_id":"0af2d92b-7ef3-48ce-8245-d63ea79e62bd","year":2024},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.287162Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:3bc438a8d67ebe3344ece04c444eb70721d94bd81a5b9fcaa7ab683346de0cef","observation_id":"0b575bae-4391-42df-9f0a-3a9a92463523","resolution":{"observed_at":"2026-08-07T00:32:55.835270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:32:54.400821Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:54.400821Z"},"links":{"citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:4ea7e6dcbbd97c83eed81ab75ac944ba933c15bb1b5bfc45dfcbf0eddc3571bd","observation_id":"ea620ca8-f979-4a01-ac43-e0762f4be893","resolution":{"observed_at":"2026-08-07T00:32:54.400821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:25:29.162842Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":36,"verified_exact":9,"verified_fuzzy":21},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.13672."}