{"as_of":"2026-08-11T03:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2182501eb85310b38e1d5246074a7442ef413f31b423c1466d6c9306115062f","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:04:46.991531Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.12620/citation-record","integrity":"/paper/2501.12620/integrity","json":"/paper/2501.12620/citation-record.json","paper":"/paper/2501.12620"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.092043Z","title":"For the model update phase, the computational overhead is Oupdate = Oforward + Obackward, (15) where Oforward = Obs1 ∗ B ∗ Nbatches ∗ Nupdate epochs (16) and Obackward = Oforward ∗","venue":null,"work_id":"aa81d5e0-35f7-497a-a54d-e6ccad028ff1","year":2022},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.986726Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:22cfe93c984d5a2a64572b0049c33f0e19c9e6860ffb2aa0ff366a189f84b5d8","observation_id":"7f2a4f0d-9d03-48c4-b149-e1c74b208cc8","resolution":{"observed_at":"2026-08-10T17:04:47.098382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.073792Z","title":null,"venue":null,"work_id":"5c7282a4-e3b5-4baa-9608-800e5195670b","year":2018},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.991531Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:6f4ac570cce6ef56c43b85cf278e672513dfd42e666c9b8403fc9ad6a89edf5a","observation_id":"65ed9f9b-8195-4b85-944d-24baca67a081","resolution":{"observed_at":"2026-08-10T17:04:47.080523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:46.939324Z","title":"Dropout: a simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.939324Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:bc23e031c1a0ae6453338b6d8dc2e9d2bc7fbc62784fc9c4f2aa27bdec341fde","observation_id":"a89d4666-b8f9-41cd-91a4-69b343c95dbe","resolution":{"observed_at":"2026-08-10T17:04:46.939324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.213101Z","title":"Rewarding episodic visitation discrepancy for exploration in reinforcement learning","venue":null,"work_id":"28d88b3a-6c33-417d-9ae4-0d3de9acd5f4","year":2022},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.949106Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:d22428715d25490c63f7600b664c853774b0faf8cde6e9daca4f1a2943c94fa8","observation_id":"d40834fd-d09a-4ba2-bdc1-9e44facb1add","resolution":{"observed_at":"2026-08-10T17:04:47.218309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.110610Z","title":"39 Adaptive Data Exploitation in Deep Reinforcement Learning G","venue":null,"work_id":"00d0e94d-1457-40e2-b1bd-7fdf3dd1dc13","year":2020},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.981908Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:03725e1a1be6d9455e5e454af4dab459950fb178d095592a90573987e515193f","observation_id":"333312ed-983b-4693-880c-71b6b4fedfbf","resolution":{"observed_at":"2026-08-10T17:04:47.116608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.162330Z","title":"For each Procgen environment, Table 2 lists the best augmentation method of DrAC as reported in (Raileanu & Fergus, 2021)","venue":null,"work_id":"a4f2bd81-7115-4c25-805c-5ad745798954","year":2021},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.964423Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:cc40331bc37f5381b440a5552880a986241e2b10d019dbd43f2ddd439f302e3c","observation_id":"fe75fc48-d6e6-479d-87b7-6fa62bc6a6fe","resolution":{"observed_at":"2026-08-10T17:04:47.167648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.144873Z","title":null,"venue":null,"work_id":"cceaff67-adfc-412b-b89b-9c8e36dbf4bd","year":2018},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.969282Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:e5f3bc8468bbda4bbaef9cdfb8538e4f72f49a58f3fa8d2009e3f8aec3f9fca7","observation_id":"fb566a84-2e95-438d-85f2-fc2e5af83878","resolution":{"observed_at":"2026-08-10T17:04:47.150079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.179138Z","title":"In this part, we use the official implementation (Raileanu et al.,","venue":null,"work_id":"5f8de48c-4499-4a8c-95a6-21baf99146e2","year":null},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":255,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.959568Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:2bc657435dab9f380f2c3208640bd18a83388800b580c3c5513c45f3ae2c9b2c","observation_id":"259c1f85-2aa2-489f-ab05-dcbad524c1d4","resolution":{"observed_at":"2026-08-10T17:04:47.184069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.228925Z","title":"Master- ing visual continuous control: Improved data-augmented reinforcement learning","venue":null,"work_id":"e4e4780d-99ab-4b0b-b9d5-e7b645b9afce","year":2020},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.944177Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:e771dbf3069fc778cfa094167c9a1335a71dbfdffa73bef13ae36d1ef67c9b2d","observation_id":"9c485d65-63f3-4807-99df-0f1f09e34cf8","resolution":{"observed_at":"2026-08-10T17:04:47.233746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:46.906488Z","title":"Badia, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.906488Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:1bbc95dbfbf95fbdc1d47fa1fe32cb8531ef68452ea35575510f96ab9201d931","observation_id":"87514cc3-0225-44c3-b39f-58edfedd4a4a","resolution":{"observed_at":"2026-08-10T17:04:46.906488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T17:04:46.934094Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.934094Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:2245a104cfdc6960587c6720ddc8e62eb936305983f33d1c4d70d7aaa1db7e13","observation_id":"6ca56ebb-5817-4acc-81da-c4e7c5225dc4","resolution":{"observed_at":"2026-08-10T17:04:46.934094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-10T17:04:46.928969Z","title":"Schulman, J., Moritz, P., Levine, S., Jordan, M., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.928969Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:a670f2ae50b2bc5a87bc4b76eb972e0b666124850e6ef29e15490530b0868e42","observation_id":"95a66473-883c-4354-9c20-b71e6da1e9b8","resolution":{"observed_at":"2026-08-10T17:04:46.928969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.195861Z","title":"The policy loss is defined as: Lπ(θ) = −Eτ ∼π [min (ρt(θ)At, clip (ρt(θ), 1 − ϵ, 1 + ϵ) At)] , (7) where ρt(θ) = πθ(at|st) πθold (at|st) , (8) and ϵ is a clipping range coefficient","venue":null,"work_id":"e92fcc5d-6acd-4e7b-9b61-acc06a6462d8","year":2015},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.953806Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:4f008084f25c7f6d0d13046fdef5d9ed233745d1c6cb7ef61a11417ff32c1947","observation_id":"1ca8056b-83fc-42b3-a864-a3be104dc8ee","resolution":{"observed_at":"2026-08-10T17:04:47.202730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.270798Z","title":"W., Hilton, J., Klimov, O., and Schulman, J","venue":null,"work_id":"53915c00-90f8-4f0a-8104-48919f721248","year":2020},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.918613Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:606a5429bb9986b0a648288f6b170430208d9d1feaa91c195d520a0d133488fb","observation_id":"6e537524-2daf-403f-baa6-79ea88b20ef2","resolution":{"observed_at":"2026-08-10T17:04:47.276136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.255136Z","title":"and Bai, Y","venue":null,"work_id":"7a288b90-5e84-4a31-9ac0-9070b23f5a3c","year":2016},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.923653Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:7648f9cdff11c54320583c4ce30a4f532dba4f244af76242aef7cd5ad76be9d3","observation_id":"bfe265ff-ab1a-4d37-8bf0-a4fc32e9d83c","resolution":{"observed_at":"2026-08-10T17:04:47.260283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.128666Z","title":"Then we test the PPO agent with three ADEPT algorithms","venue":null,"work_id":"249e8256-a286-4b39-9886-a0dbfb14802d","year":null},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.975605Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:5765aaa61cfd0a924354af670d74a5cd830e6f2a102db9162d2d3da7e622a240","observation_id":"a98bf03c-5a33-4f71-9165-891d7b25f8fe","resolution":{"observed_at":"2026-08-10T17:04:47.133881Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:04:47.286775Z","title":"Lever- aging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"7a91f22e-0b7d-498c-9235-8c2d2db96176","year":null},"citing_paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T17:04:46.913255Z"},"links":{"citing_paper":"/paper/2501.12620"},"observation_digest":"sha256:2b39dc47e85a7e0c20701c53cae9c0a8f40fc2fe1553178fa10725c5555d7b55","observation_id":"85907215-7784-43fc-b120-2d3353e04b07","resolution":{"observed_at":"2026-08-10T17:04:47.291854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12620","last_updated":"2025-01-22T04:01:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T16:56:54.278091Z","submitted_at":"2025-01-22T04:01:17Z","title":"Adaptive Data Exploitation in Deep Reinforcement Learning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2501.12620."}