{"as_of":"2026-08-23T15:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb6210a22b7c309cf789fda9b8274876fa8472665b7dd586ffdd87135698a646","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:10:56.813881Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:04.763706Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T04:39:12.260604Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"cited_work":{"arxiv_id":"2506.03404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03404","snapshot_observed_at":"2026-08-06T04:39:12.260604Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","venue":"cs.LG","work_id":"1dd0baea-8f36-494c-a9ec-b7a99a6a6425","year":2025},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.763706Z"},"links":{"cited_paper":"/paper/2506.03404","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:be47cfe4cb3f42c68f708c1da83916ed4842de6c1215d65fa65cfaace74b0475","observation_id":"b41a1983-3b77-479e-b2b4-547f72c1f91f","resolution":{"observed_at":"2026-08-06T04:39:12.305554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03404","snapshot_observed_at":"2026-07-31T03:42:27.912475Z","title":"Mayor, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28560","last_updated":"2026-08-11T11:06:31Z","snapshot_observed_at":"2026-08-14T23:11:53.837540Z","submitted_at":"2026-07-30T17:26:12Z","title":"X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T03:42:27.912475Z"},"links":{"cited_paper":"/paper/2506.03404","citing_paper":"/paper/2607.28560"},"observation_digest":"sha256:a2a5af316ac17ca2180ce75e07eb9d481a960d92c281c98cc39730d79b6379f1","observation_id":"1e5e70de-29c6-4ecc-b668-a7a735505cbe","resolution":{"observed_at":"2026-07-31T03:42:27.912475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03404/citation-record","integrity":"/paper/2506.03404/integrity","json":"/paper/2506.03404/citation-record.json","paper":"/paper/2506.03404"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.930552Z","title":"Legged locomotion in challenging terrains using egocentric vision","venue":null,"work_id":"90602004-2d94-47bf-a577-c20b42170dc0","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:50.577389Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:62da0b23b8ba833d4f176f12ac1a54eaa700c461aa00ee9772f21a94aa6d9ebe","observation_id":"a7478523-5f34-4159-828e-329773f49616","resolution":{"observed_at":"2026-08-07T11:10:59.936575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.914174Z","title":"S., Courville, A","venue":null,"work_id":"673918a9-5a2a-4a6b-89ad-7a41b951da3d","year":2021},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:50.681503Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ef83993682fa881406836f0199e2765727bf30229ef1ce6d5fe115f303242f8e","observation_id":"eca2519f-50f5-457a-b265-69a03635d151","resolution":{"observed_at":"2026-08-07T11:10:59.919469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.899519Z","title":"Atari-5: Distilling the arcade learning environment down to five games","venue":null,"work_id":"995fe753-8028-401a-bd09-a06fe2aad418","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:50.822599Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ae84b82963b286b715e248d8feee70736a84c53ae0d7a89c011d597db80fd7a1","observation_id":"571ba2f3-5c9f-4f20-9e7d-abee91a456fa","resolution":{"observed_at":"2026-08-07T11:10:59.904246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.885121Z","title":"What matters for on-policy deep actor-critic methods? a large-scale study","venue":null,"work_id":"e02afb8e-8281-4440-bcb2-1b1490f37f50","year":null},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:50.930798Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:f4c1a5b81e84d088089274fc751c18c03d6ed50d6fad557b535837a0e8735a3e","observation_id":"76acbe79-a8e9-4cab-bcc0-6246775d7094","resolution":{"observed_at":"2026-08-07T11:10:59.889803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.867573Z","title":"For valid generalization the size of the weights is more important than the size of the network","venue":null,"work_id":"a21b297f-c174-46d9-8ff0-5d4953f00340","year":1996},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.006939Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:8b57fc8eed35595de5be5bb8e7ee6af5df7707e1a6285efc5985ebe77d8f42bf","observation_id":"219395e5-b7f9-4581-9bba-c6f5fe5cdafb","resolution":{"observed_at":"2026-08-07T11:10:59.873599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:51.082010Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.082010Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:47d212a73bcfb375a0d2939dc49a4fd33b29932da05f2586d4ec54a6685f9d65","observation_id":"82f633c1-36fa-4f3b-9675-83503e95af7c","resolution":{"observed_at":"2026-08-07T11:10:51.082010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.851842Z","title":"G., Candido, S., Castro, P","venue":null,"work_id":"ec3f8b45-a4d4-45ae-a099-28a527bac5f8","year":2020},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.190942Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:3eaa7740e73b6f9ecae23903670b7d98ab9bc2a9c4a1cf6902beb6dd8909685c","observation_id":"a5784aab-2c03-40b8-be08-c67910cd0629","resolution":{"observed_at":"2026-08-07T11:10:59.857014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00042","last_updated":"2023-10-14T11:58:06Z","snapshot_observed_at":"2026-08-16T18:20:45.624911Z","submitted_at":"2021-05-31T18:21:06Z","title":"A study on the plasticity of neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00042","snapshot_observed_at":"2026-08-07T11:10:51.302257Z","title":"A study on the plasticity of neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.302257Z"},"links":{"cited_paper":"/paper/2106.00042","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:d53a961c77ee1902ddbb48ec16f1802f5432849516dd642495ccee2eed3e8899","observation_id":"d3718954-094b-45de-a396-ac95505cd461","resolution":{"observed_at":"2026-08-07T11:10:51.302257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.836060Z","title":"Exploration by random network distillation","venue":null,"work_id":"1feed705-0921-431b-b5e1-cd7c1b20d914","year":2019},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.404834Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:4fa934d22f3a78317e51557d0d2078b10e1b6ae63dff4e4dd39e4fb96d67faa5","observation_id":"bef80737-9e1b-48f6-bb76-b0eef9fbdee6","resolution":{"observed_at":"2026-08-07T11:10:59.840899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.821442Z","title":null,"venue":null,"work_id":"935eac5a-09df-417b-9b20-007d9923017b","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.480111Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:f0214f93f3f4e4bfe3cb3dbeff3e8a4b513babb17f7b0553a6f97e26c820e441","observation_id":"b790cf31-f0a3-49fa-b27c-c0d0fb5d1e50","resolution":{"observed_at":"2026-08-07T11:10:59.825947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.806686Z","title":null,"venue":null,"work_id":"70570ce0-2c44-4ea1-8920-bc94f2bd7e5b","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.590597Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:17904dce5db55af6986eff5a00b299121e67c275f0b47aabad3003ebb4092b3f","observation_id":"bc5d8d8c-d2b8-43e5-ae2e-0ec11043beb1","resolution":{"observed_at":"2026-08-07T11:10:59.811644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.791878Z","title":null,"venue":null,"work_id":"6302e6aa-673f-4551-bbd1-056127407048","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.671223Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:5c2ba9645fd0dc9591d4ef3e9bd686a75df0e7546d48d9d6be57204b3552b4b7","observation_id":"39ebc3a5-1749-4a69-8e84-61b0c10a9d4e","resolution":{"observed_at":"2026-08-07T11:10:59.796803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.776394Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"23cc35dd-22a2-42fe-bbbc-71ef9b6ae917","year":2020},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.791789Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:2ef98d2a73676431f48972d9450a6739b03aa15f0a1e8c928e53345ae6733c98","observation_id":"b4ce3b45-129a-4503-a1d1-13fedd8621e3","resolution":{"observed_at":"2026-08-07T11:10:59.781253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.759340Z","title":"W., Hilton, J., Klimov, O., and Schulman, J","venue":null,"work_id":"721316d3-fab8-45a1-9466-65b2e95a8e3c","year":2020},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.865317Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:a248f05a43e02fe9971bc98b18f879368de4e3c6841c96b5f1333889e793db47","observation_id":"d0e80eec-7e75-4be7-b861-4e9fa25ef278","resolution":{"observed_at":"2026-08-07T11:10:59.765317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.742718Z","title":"G., and Courville, A","venue":null,"work_id":"e0fd8c1f-0c3e-42b6-8c88-062623fb28c7","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:51.974574Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:783b8332d9ee406e600b74bb9efc06f78872a7f92f96036a74c66fdd6359e0ad","observation_id":"52af0b67-690b-46a6-a601-0631541f6e2e","resolution":{"observed_at":"2026-08-07T11:10:59.747354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.726644Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"18f3fe55-021d-4077-9e16-e3efe8cff8b9","year":2018},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.109804Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:3a7f0eb01459017db74d9148368e5c0db3df9ba57192872c902dbd0ff51b1348","observation_id":"2a11f4f1-8013-438b-ad3d-3eb51ff26f66","resolution":{"observed_at":"2026-08-07T11:10:59.732265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.710855Z","title":"J., Schrittwieser, J., Swirszcz, G., et al","venue":null,"work_id":"1b7b5e22-c8c0-4485-9e99-83dc84937963","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.250460Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:6c0a51325bcb55663da35a64685a172852815e811df5e3bb33b1e79285b64e61","observation_id":"dbffcd19-57e9-4cb5-b01d-a6fca9cd7eea","resolution":{"observed_at":"2026-08-07T11:10:59.715679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-18T21:41:20.439669Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-07T11:10:52.373117Z","title":"N., and Martin, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.373117Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:d921a625036c3cb1a5890df02a7e7c388bd922c2de71e825806318000b832908","observation_id":"f5e31804-8085-4696-9cd2-b998016c275e","resolution":{"observed_at":"2026-08-07T11:10:52.373117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.695868Z","title":"On proximal policy optimization’s heavy-tailed gradients","venue":null,"work_id":"5709f463-efe4-429a-b0f8-1343b6c1cba4","year":2021},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.546240Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ce19b4c64a6e9f819a12a600eba1db1f69ecca80980600597c5760bc0ff84917","observation_id":"bcd6fdd8-3c73-4499-8318-693b46e9710d","resolution":{"observed_at":"2026-08-07T11:10:59.701132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.679788Z","title":"Dextreme: Transfer of agile in-hand manipulation from simulation to reality","venue":null,"work_id":"513e645a-c7f8-4f9e-af71-3fde58380351","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.716828Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ef3365b52df459dbe3a558a0db46b8141ebc55753ab145944e51d15306bd5256","observation_id":"11584fc6-20df-49e0-af8d-2facb6f4701c","resolution":{"observed_at":"2026-08-07T11:10:59.685179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:52.869452Z","title":"R., Millman, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.869452Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:e4bdf15fbfdc853faf8eb3ae79a213a8f5921c7dff42391d0493bf6d2aa3e964","observation_id":"5589d461-98e0-45f2-88dc-bcb933111d06","resolution":{"observed_at":"2026-08-07T11:10:52.869452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.655018Z","title":"Batch size-invariance for policy optimization","venue":null,"work_id":"de82f5de-dafa-452e-9d79-9c3fe2818b7f","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:52.991453Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:12d95e21059d521dcfc572d19792fa67e8cc99c737028e2547006c5268798a6c","observation_id":"40b2fb77-f918-43b9-ab7f-aadb9e97db1d","resolution":{"observed_at":"2026-08-07T11:10:59.659797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.0580","last_updated":"2012-07-03T06:35:15Z","snapshot_observed_at":"2026-08-15T00:54:35.320150Z","submitted_at":"2012-07-03T06:35:15Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.0580","snapshot_observed_at":"2026-08-07T11:10:53.121164Z","title":"E., Srivastava, N., Krizhevsky, A., Sutskever, I., and Salakhutdinov, R","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.121164Z"},"links":{"cited_paper":"/paper/1207.0580","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:fd4506710684065a6582c47eb7fcc512a905d9c4f10859227151f4fdf0352f97","observation_id":"47a78221-96cd-464a-b575-f848978328a0","resolution":{"observed_at":"2026-08-07T11:10:53.121164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.639901Z","title":"Distributed prioritized experience replay","venue":null,"work_id":"632c2ae9-d270-4651-8ee6-16d356eb5f9e","year":2018},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.283231Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:2514b99ece7118366bdef2cc30dcf8b6e06ba40cb861357789cd4bd59b2c711d","observation_id":"9b31ffa0-c969-4779-9af7-a2202f45b268","resolution":{"observed_at":"2026-08-07T11:10:59.644776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.624668Z","title":null,"venue":null,"work_id":"f92c8b18-6279-4d94-8b2b-0577ef5005a2","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.428581Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:e7f5d1bf71c24ebc1f6e754f413e443d8b2154d2d729b8292de2a1a2f5fc129a","observation_id":"1609a777-1a3a-4e2a-8a52-92d58ef693f0","resolution":{"observed_at":"2026-08-07T11:10:59.629200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:53.555451Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.555451Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:11d6fd4b481427530adeff3f605916e3f7a5c9ae93f1e13bb22f64987c098c32","observation_id":"94a38b6e-e086-43a0-80ee-4c7387016298","resolution":{"observed_at":"2026-08-07T11:10:53.555451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.599557Z","title":"and Ash, J","venue":null,"work_id":"993129f6-2d9e-4bc2-82d5-be29e74ebc12","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.693189Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:2db61306768be32003a18d4c0503468186af2c4114b7f399d20cbe03304c5a4b","observation_id":"676b5648-f490-4464-826c-df05ab3f8967","resolution":{"observed_at":"2026-08-07T11:10:59.604208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.585321Z","title":"Towards continual reinforcement learning: A review and perspectives","venue":null,"work_id":"5d2443d3-0f99-44f4-b77c-98d153f8dea0","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.845305Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:baea615d2066c85761f8e167b8603b5d1d7dcd116af386d002725fa3a90157b1","observation_id":"a879af75-e04f-4e35-9f53-61460d987519","resolution":{"observed_at":"2026-08-07T11:10:59.589994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:53.949280Z","title":"Jupyter Notebooks a publishing format for reproducible computational workflows","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:53.949280Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:c37b77e4e69f4dd223c849a1803a22a465c966821360bd56a95cb7c52a2cd74d","observation_id":"c09adde5-fd01-4b0f-a4a6-3699c3b16d81","resolution":{"observed_at":"2026-08-07T11:10:53.949280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.569164Z","title":"Pgx: Hardware-accelerated parallel game simulators for reinforcement learning","venue":null,"work_id":"9e99842b-5116-4ddd-bf9a-12d8e0bff97a","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.030157Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:751120467c816f9d0b7466093e57c62ce87ec5a98ab4b9f80d536ce92be3055c","observation_id":"2a0fc276-8440-46d6-bd57-aa6031fa05da","resolution":{"observed_at":"2026-08-07T11:10:59.574876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.554095Z","title":"and Hertz, J","venue":null,"work_id":"5af0d97b-27ab-4402-ac66-08400505d164","year":1991},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.088568Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:4cbf728545d808f57125a1ea519ab45c6b774aa11dcd64b3f167a4590b86968a","observation_id":"3e02f3ea-0060-49b1-93de-fe0d54cac90d","resolution":{"observed_at":"2026-08-07T11:10:59.558735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.539648Z","title":"Offline q-learning on diverse multi-task data both scales and generalizes","venue":null,"work_id":"50f46dae-f627-4899-ae6b-77170283ad56","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.171200Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:4a3816e7e6229747b3bf3a9b4c1f2a79967f88ec51ecda593ca38cfb975d0c19","observation_id":"43361f58-4609-4e0f-bc1b-5e62d2ac69b3","resolution":{"observed_at":"2026-08-07T11:10:59.544356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.523665Z","title":"Parallel q-learning: Scaling off-policy reinforcement learning under massively parallel simulation","venue":null,"work_id":"a564f5bd-095d-43e6-83b6-01b36fc4f186","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.230127Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ab29059cf42c2ed563e3d4127a22830d4e8429d7c993c468d9b17b84009f16d4","observation_id":"1b1e5666-0590-49ed-84f1-0c405a28fb0b","resolution":{"observed_at":"2026-08-07T11:10:59.529509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.508411Z","title":"Acceleration for deep reinforcement learning using parallel and distributed computing: A survey","venue":null,"work_id":"220e5e99-867e-4f73-9206-846aa1cf0b25","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.320604Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:8d7b32ebd55f98b031cdfa806cf5217075b706b9571476c2f8f5220a89fcaf9a","observation_id":"264841e4-5bda-479e-a944-1876f49d008b","resolution":{"observed_at":"2026-08-07T11:10:59.513507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.492654Z","title":"A., Pascanu, R., and Dabney, W","venue":null,"work_id":"e9735404-37d5-4792-b3d9-5fa48c6cb966","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.383599Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:6a75e880cb707849197ec7b6fee087af402fabcf02ced15be03706a6e6cea903","observation_id":"7e44d3bd-6e34-4e2a-8b14-afcce4061a00","resolution":{"observed_at":"2026-08-07T11:10:59.497335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.477195Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":"33a345d7-c241-4015-a15a-8d62a94e6c8b","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.467915Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:34f94ab243308f2dab9d00d35a847586ad2ae240f096a023652c1c01a32e6904","observation_id":"917d4bc0-6e8f-48c0-a988-d96952adf577","resolution":{"observed_at":"2026-08-07T11:10:59.481988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.460274Z","title":"Isaac gym: High performance gpu based physics simulation for robot learning","venue":null,"work_id":"b145d507-4558-40b8-bffb-55c88ebf115b","year":null},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.533625Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:79a5a211325b7afa810c4879a44c57554319c14cc661f0f3bdd1d8038d6211b8","observation_id":"2bf21423-092c-4922-9f4e-fe8c9e547e9b","resolution":{"observed_at":"2026-08-07T11:10:59.466708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.433455Z","title":"Miles 430 macklin, david hoeller, nikita rudin, arthur allshire, ankur handa, and gavriel state","venue":null,"work_id":"fe4b96d9-2e7b-44c9-a788-f473310eb1c5","year":2021},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.618476Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:3cfabcf3e637107fb57328cacb926391f35b76a650967832f6cd51e4f01bc57e","observation_id":"8e2ba856-57b3-4b9e-8d54-dcde6050eae7","resolution":{"observed_at":"2026-08-07T11:10:59.442272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.406189Z","title":"Effective sample size for importance sampling based on discrepancy measures","venue":null,"work_id":"69efb877-c21a-42f9-a1fd-721a0c9dc5ed","year":2017},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.686514Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:66bd2c73391cacad2b9efa3c726307b63d1ca781e0ecc7a576010a7fa9e19644","observation_id":"6446cfa2-0deb-485f-ac30-c3cbf7b88837","resolution":{"observed_at":"2026-08-07T11:10:59.415794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T11:10:54.774055Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.774055Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:3739cd3a31454d1b7a316da26f77c0da01e5c0b3b48de90b83905193a919aa84","observation_id":"354dc75a-d6a4-40eb-8b30-7e2102f5f9d6","resolution":{"observed_at":"2026-08-07T11:10:54.774055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:54.851806Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.851806Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:61664cda27aa871519491ba9809dc4346c9da5c0deef627f008fa5ea0fb538c8","observation_id":"b197c519-9bdf-4b5c-8e56-32587cc049d7","resolution":{"observed_at":"2026-08-07T11:10:54.851806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"asin/1449319","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:57.370670Z","title":"Python for Data Analysis: Data Wrangling with Pandas, NumPy , and IPython","venue":null,"work_id":"87a6c11c-9b24-457d-960b-e224f776c092","year":2013},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.925526Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:0a5df4f47588722e7e38d29969ce6b788a6854f413d86a114dcc0836264fc572","observation_id":"afa4a030-c641-411b-b056-91813d20da71","resolution":{"observed_at":"2026-08-07T11:10:57.459055Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.383604Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"a759f720-88f6-4d48-a39e-c1bfc64bd983","year":2015},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:54.989498Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:27d8797fe4d8a9dcd378756abc43eb21d463f6f976428179915e1a4bf877211e","observation_id":"80c828c3-22a4-4681-b5e9-92f10a26b9f5","resolution":{"observed_at":"2026-08-07T11:10:59.391830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.367801Z","title":"P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., and Kavukcuoglu, K","venue":null,"work_id":"19c822d4-0e8b-48ce-b373-baaf68610fcb","year":1928},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.054387Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:9ac138007cafa3fe71638676af17e4304d9d56acb358969d527b0ad595bb2dc8","observation_id":"a7233b5d-e8cc-4867-abaa-847a04c8aabe","resolution":{"observed_at":"2026-08-07T11:10:59.372906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.354497Z","title":"No representation, no trust: Connecting representation, collapse, and trust issues in PPO","venue":null,"work_id":"14b6ac1c-cae6-4c13-bb4f-2c7584d6a284","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.127038Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:6472ab275c7d9aeab0cb01a98775907f4a2bfd52cf9155bf0a1e1eb7b03fd99f","observation_id":"a98241fb-3818-4373-a708-bbdede5fd2b5","resolution":{"observed_at":"2026-08-07T11:10:59.358770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.341275Z","title":"Norm-based capacity control in neural networks","venue":null,"work_id":"1293dbe1-2a55-4fc5-95e0-e3fd86c72de3","year":2015},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.192525Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:c01559ef48429e9825e82a335c17d0b5fa36c8b710bc9d26c922507a01e1f73e","observation_id":"fc7778c9-5794-47da-95b5-bb38ed837f83","resolution":{"observed_at":"2026-08-07T11:10:59.345422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.326538Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"e2420be4-8f58-4656-9750-293b9db3b08f","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.259003Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:1127e574282b81fe9458294fa5dd227ae01a3158744528f4002dbf77e33ec2f7","observation_id":"7254eb03-ea12-4244-8119-4f96a4d31527","resolution":{"observed_at":"2026-08-07T11:10:59.330873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:55.342249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.342249Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:a282d48ff360b201a040cf6228cf54b7f9153a4d1c2f0b941738b174400b8fc7","observation_id":"ac6d4c1c-c889-4aa1-8173-1cbbbf43c765","resolution":{"observed_at":"2026-08-07T11:10:55.342249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:55.407723Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.407723Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:3a9a7393d22b0a7a699e7bb3187f719c80852c2801ffb41a532c580fa4574a9f","observation_id":"fc573517-658a-4e6b-89af-cc77f4fe6503","resolution":{"observed_at":"2026-08-07T11:10:55.407723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.302449Z","title":"Sample factory: Egocentric 3d control from pixels at 100000 fps with asynchronous reinforcement learning","venue":null,"work_id":"915cef1e-2cda-4ff9-92c1-59fa9f480759","year":2020},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.485324Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:cc6d2001c9fcb664bcc17c42c5d8b44272b8adeb9217a70c014ce150a96d2546","observation_id":"9b3337b4-6569-40e4-9ad4-22b17f4c5765","resolution":{"observed_at":"2026-08-07T11:10:59.307664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:55.547935Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.547935Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:eea980bc6ab78539f481544d4b7c6dc2edd15d824276ca3bee9db45e758ec83f","observation_id":"032c4486-49c1-41d8-ad3b-42ebd99f1854","resolution":{"observed_at":"2026-08-07T11:10:55.547935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.278074Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"05371bb6-fc21-45be-97b8-f2097fe7c7e5","year":2021},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.639597Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ce16bf6ad4a7b83b5237e1ee47aecf275d0ca5ae937bc789fa9b8f4e8c3be9c7","observation_id":"f12342c5-d575-4341-ac56-e4f73fb51afe","resolution":{"observed_at":"2026-08-07T11:10:59.282915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.262379Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"675f24c6-44ac-454c-843b-a479f1e9a6c8","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.711184Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:7cbb5b499fe456636c62fa0cf07d3c479ac6b2c42f73830625d6aaa650addbd7","observation_id":"1bcfc36c-c96d-47f0-9cfd-b7b6296414bf","resolution":{"observed_at":"2026-08-07T11:10:59.267385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.248081Z","title":"The phenomenon of policy churn","venue":null,"work_id":"bc10c442-3d19-40d0-bac2-449d1dc5c37a","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.765152Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:84f82c58f62f23af59472b4540a4beee8eb9c566829441e8c29c99760efb5585","observation_id":"14e36ee4-2e16-4c8a-beef-43e2603acf4e","resolution":{"observed_at":"2026-08-07T11:10:59.252411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T11:10:55.847662Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.847662Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:5c1ea0c96c8985f1207a24864c85030f5ce26adcd1f9b4264084744f32d90832","observation_id":"c368cf97-041b-48af-bdb6-f298ceda84f4","resolution":{"observed_at":"2026-08-07T11:10:55.847662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:10:55.920896Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.920896Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:3c0db6e5cbe279dc35fa4842632ff07983ee9174c0b8031d402ab18522220e65","observation_id":"4ef8e964-a9cf-43e6-a3eb-b89e641d65c9","resolution":{"observed_at":"2026-08-07T11:10:55.920896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.233737Z","title":"S., Courville, A., Bellemare, M","venue":null,"work_id":"dbf99896-f11f-4b86-952d-862815e624d9","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:55.988811Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:f5c15be4231acf6d5f84dd7cbdc1bc558acbcd35a898f9127be181820ae2aa88","observation_id":"4f289300-b452-4889-b3b7-7c01764726e7","resolution":{"observed_at":"2026-08-07T11:10:59.238508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:59.071758Z","title":"J., Lee, J., Antognini, J., Sohl-Dickstein, J., Frostig, R., and Dahl, G","venue":null,"work_id":"0a99d131-2645-4106-b770-673ae86fd46c","year":2019},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.064409Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:1c1f63456140d783263a78ce7f01199acb70f68d5ce3410ea0798fe878a37e24","observation_id":"0cb3a222-bdeb-45d7-85e4-a616a2991a65","resolution":{"observed_at":"2026-08-07T11:10:59.178129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:58.915443Z","title":"Sapg: split and aggregate policy gradients","venue":null,"work_id":"1b7b4501-a07e-4f0a-aa6f-13f3fbfc9580","year":2024},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.126658Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:ac15352be89b3b7844eeaf62045c62d848390cbeeecea85f4dcdf976b80b3957","observation_id":"abe86cf0-bd5f-494b-824c-013f135ba93e","resolution":{"observed_at":"2026-08-07T11:10:58.997221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:56.179277Z","title":"S., and Evci, U","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.179277Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:79fa58875a8dbf0c56d5964912b2d1a681978d5d8f6834cd12e46a413fc7ab93","observation_id":"0a4672f4-237c-4c86-be5b-1137a9a46641","resolution":{"observed_at":"2026-08-07T11:10:56.179277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02811","last_updated":"2019-01-10T20:48:11Z","snapshot_observed_at":"2026-08-18T07:59:54.298447Z","submitted_at":"2018-03-07T18:39:12Z","title":"Accelerated Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02811","snapshot_observed_at":"2026-08-07T11:10:56.234793Z","title":"and Abbeel, P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.234793Z"},"links":{"cited_paper":"/paper/1803.02811","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:fd3a93239e9f5c17886b354c3c6313164ebc34d9f2a6810faabd31faf922f470","observation_id":"68e03082-6f50-4286-8bfc-2cd3a5b24c09","resolution":{"observed_at":"2026-08-07T11:10:56.234793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:58.720803Z","title":null,"venue":null,"work_id":"26364c80-dcff-4176-a196-d856a5ae48a6","year":2018},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.306208Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:d6ccf2e8ae16748d5638ad71ce43597d13fe887a975c0aa67a49e57981503a3a","observation_id":"11bd33a0-7a25-481c-8618-cf7046543f65","resolution":{"observed_at":"2026-08-07T11:10:58.802545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:58.493424Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"571dd77b-bf01-406f-9f4c-54e4605c2b33","year":1999},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.357213Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:69eaa222b7e15adb809890d7ba09862d1165c88821254fd280c6847e208a4e7b","observation_id":"86306a07-ffab-4a05-86f8-92240486037e","resolution":{"observed_at":"2026-08-07T11:10:58.587494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:58.302940Z","title":"A., Fedus, W., Machado, M","venue":null,"work_id":"7877f040-0f46-4625-92f3-f6857a9e8aab","year":2020},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.412049Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:2c8363f8e9ccf9a19d4a0d62f756793f9dd40c6a7e49899d49a7c94c48064043","observation_id":"435e7a6c-2469-4ed2-a692-fdb08da1f265","resolution":{"observed_at":"2026-08-07T11:10:58.401749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:58.032217Z","title":"A., Agarwal, R., Farebrother, J., Courville, A., and Bellemare, M","venue":null,"work_id":"2e144206-bcc3-4fca-9d47-f8f565059af3","year":2023},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.470615Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:cc082845ec502db4340c7d219f4bee739408e14d021b059fecfac17f8d26e3dd","observation_id":"747a0e0b-7143-4187-9cad-6ebcc4c07e27","resolution":{"observed_at":"2026-08-07T11:10:58.128727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:56.559420Z","title":"and Drake Jr, F","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.559420Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:d68d18a836fec2462e4ff8d6a58c70143b2735e3ed9ef29d66a6208fcb4b4be0","observation_id":"ffe6d0ce-047f-4e73-b353-c94cfea9a4e8","resolution":{"observed_at":"2026-08-07T11:10:56.559420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:56.624491Z","title":"M., Mathieu, M., Dudzik, A., Chung, J., Choi, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.624491Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:0186d05eed28ace5f019ac76409c81afc8f8fa1292cf9bcf58b31c2d43447b88","observation_id":"c53b78ef-7ec3-40bc-b3e8-b042d2b9e34d","resolution":{"observed_at":"2026-08-07T11:10:56.624491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:57.739225Z","title":"Envpool: A highly parallel reinforcement learning environment execution engine","venue":null,"work_id":"6b2c3d29-54cc-46ab-b7fe-337e9b939aeb","year":2022},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.670482Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:eeb9a4c0b1d98431cc24f42b94cf2c3b532478a8e534755d91e0efa5c4c6145c","observation_id":"34afcb2c-3a8a-4423-895f-062d333cc788","resolution":{"observed_at":"2026-08-07T11:10:57.809245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12255","last_updated":"2020-07-04T15:53:48Z","snapshot_observed_at":"2026-08-05T05:32:27.694291Z","submitted_at":"2019-09-26T17:01:23Z","title":"Harnessing Structures for Value-Based Planning and Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1909.12255","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.12255","snapshot_observed_at":"2026-08-07T11:10:57.000090Z","title":"Harnessing Structures for Value-Based Planning and Reinforcement Learning","venue":"cs.LG","work_id":"c0fe4508-8c71-4163-8b0b-b17338e1b9c9","year":2019},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.745193Z"},"links":{"cited_paper":"/paper/1909.12255","citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:1dd7a381d493cc6690a6167048da077f751813f5b79bb84b44a9421e570e7890","observation_id":"979169ea-fcfe-42bb-964e-2503c335cffb","resolution":{"observed_at":"2026-08-07T11:10:57.065060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:56.813881Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:10:56.813881Z"},"links":{"citing_paper":"/paper/2506.03404"},"observation_digest":"sha256:1227657d795b330878594d155443b8a520e98eb0087d10f2458b553fefcd7172","observation_id":"4f3e9417-32e9-4233-8388-ff87f73ba5cd","resolution":{"observed_at":"2026-08-07T11:10:56.813881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:00:34.412692Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":44},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2506.03404."}