{"as_of":"2026-08-10T06:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff4e44d3d221562f8e60db71bb954513b964c6492f92a7a57a99ee5e38f9a867","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:36:12.619468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":105,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:039866785a7322f27ddb42e21936c41446be7e2f5e908562bde98bb459fe108f","observation_id":"11bf0bf6-346d-4a68-8682-77a61759fe70","resolution":{"observed_at":"2026-05-13T08:51:55.997703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T07:08:52.723528Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2201.03544"},"observation_digest":"sha256:32cbac3c48173062e4dfcd12e0962f6e0b9a1577b4b4367297f343bd5bc2b201","observation_id":"edd1cefa-a79c-401e-a686-fd5a82942d12","resolution":{"observed_at":"2026-05-21T07:08:52.801639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T09:08:21.677362Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2301.04104"},"observation_digest":"sha256:5a5373802aacf772125658ea3829ebdca98501a356a2bd91dedebc27f6008b79","observation_id":"5e7bc265-bb22-4746-9f1c-6b5223fd8b4b","resolution":{"observed_at":"2026-05-11T09:08:21.980352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-09T04:36:12.619468Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03560","last_updated":"2025-02-05T19:17:33Z","snapshot_observed_at":"2026-08-10T06:35:04.235857Z","submitted_at":"2025-02-05T19:17:33Z","title":"Simulating Errors in Touchscreen Typing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T04:36:12.619468Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2502.03560"},"observation_digest":"sha256:9576224a2cb28be168e336109bb926b0886123ff31ae8eacb1799d5cc9bd0226","observation_id":"0c67352e-c4d3-4b5f-b882-fb53c819e4ef","resolution":{"observed_at":"2026-08-09T04:36:12.619468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T23:34:10.862569Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-07T23:27:22.713894Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:34:10.862569Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2502.08844"},"observation_digest":"sha256:a9e0b7d8c8a9b07ae42935860538fb18dec8aa65f3f094c887b3a5e8efe34fea","observation_id":"87b35a59-608e-447d-9477-3e97bb1daa7f","resolution":{"observed_at":"2026-08-07T23:34:10.862569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T10:55:20.205546Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-09T01:33:11.458736Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.205546Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:0c7c637253077867ecf33ab44258928dbb860822579bd3e6225af13b45be8dbf","observation_id":"b4b230da-84bc-4768-b4c3-268d49f2c8c0","resolution":{"observed_at":"2026-08-07T10:55:20.205546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T04:19:22.151310Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:22.151310Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:df5a0ded52aac656333ab6a7ebe0eeff3be5471d5640554e5ccffa697bed21fc","observation_id":"58df91f7-f6d0-43f2-914c-f803515f43e7","resolution":{"observed_at":"2026-08-07T04:19:22.151310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T22:48:46.211558Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.20589","last_updated":"2026-05-31T14:57:19Z","snapshot_observed_at":"2026-08-08T10:43:33.614184Z","submitted_at":"2025-06-25T16:28:30Z","title":"Communicating Smartly in Molecular Communication Environments: Neural Networks in the Internet of Bio-Nano Things","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:46.211558Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.20589"},"observation_digest":"sha256:79b7839f94568735dd94e5dcc7051d2f039899f545ff84eda11a30125e4e620f","observation_id":"9bbad98f-46c2-43b4-bc7a-bd421c171fc0","resolution":{"observed_at":"2026-08-06T22:48:46.211558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T18:18:44.262283Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.08718","last_updated":"2025-07-11T16:19:45Z","snapshot_observed_at":"2026-08-08T04:07:41.428130Z","submitted_at":"2025-07-11T16:19:45Z","title":"On the Effect of Regularization in Policy Mirror Descent","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:18:44.262283Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2507.08718"},"observation_digest":"sha256:d13fb2a0948545abc3af286f19aaeecdf987eeae7a58044960e2bcb4328b2034","observation_id":"05e8926f-c64c-4013-be31-a7adcfd16cf7","resolution":{"observed_at":"2026-08-06T18:18:44.262283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T18:18:26.684738Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08726","last_updated":"2025-07-11T16:26:31Z","snapshot_observed_at":"2026-08-06T23:34:07.839962Z","submitted_at":"2025-07-11T16:26:31Z","title":"Learning human-to-robot handovers through 3D scene reconstruction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:26.684738Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2507.08726"},"observation_digest":"sha256:90d2876a6acd7ed2838ca8da40cad6d5a94e2bed3bb025e4bc017f770801b5e0","observation_id":"0922a89a-ec0c-4f0d-984e-0897a8430c28","resolution":{"observed_at":"2026-08-06T18:18:26.684738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-06T17:05:16.167535Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.11975","last_updated":"2025-07-16T07:17:41Z","snapshot_observed_at":"2026-08-10T01:06:14.440793Z","submitted_at":"2025-07-16T07:17:41Z","title":"Online Training and Pruning of Deep Reinforcement Learning Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:05:16.167535Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2507.11975"},"observation_digest":"sha256:8926ecfb4a53ef68643cfae0654df98e33e4625de1ba8ef4b827f4abf6910977","observation_id":"b0bd07b4-47d3-45fb-8dd6-c316ec3a8241","resolution":{"observed_at":"2026-08-06T17:05:16.167535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-03T19:16:26.948543Z","title":"What matters in on-policy rein- forcement learning? a large-scale empirical study.arXiv preprint arXiv:2006.05990,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.01467","last_updated":"2026-06-08T10:55:45Z","snapshot_observed_at":"2026-08-06T23:33:15.422373Z","submitted_at":"2025-12-01T09:50:04Z","title":"Differentiable Weightless Controllers: Learning Logic Circuits for Continuous Control","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T19:16:26.948543Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2512.01467"},"observation_digest":"sha256:e0d8723f023d1ff3b5fd8398ac0384ebb1da44bd62ccf81daeecabae218a8433","observation_id":"4d1af3aa-8b4b-4dea-865c-f087b1bfce4d","resolution":{"observed_at":"2026-08-03T19:16:26.948543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-02T18:45:20.216901Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.216901Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:47811463cf9b7535df809c2e634fed255bf0e0c08bdd00c0900694b78e788200","observation_id":"16ea3926-2720-442f-ae65-02428ba04317","resolution":{"observed_at":"2026-08-02T18:45:20.216901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:3310acaa39e65210cead0cfec381ce5e3b9fc9885cf941d089ca033968144cfc","observation_id":"b9348a80-ac48-439d-9a34-652d31809979","resolution":{"observed_at":"2026-05-11T11:41:04.216628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.18978","last_updated":"2026-05-07T15:47:31Z","snapshot_observed_at":"2026-08-08T15:22:09.895907Z","submitted_at":"2026-04-21T01:59:54Z","title":"Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:22.577012Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.18978"},"observation_digest":"sha256:82513d5d164d1ab72b4f9b0504161862ec86a619449435358c3da9e166615bea","observation_id":"0897607c-7adc-46df-8bc8-f1172f451575","resolution":{"observed_at":"2026-05-11T12:46:27.889717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.26126","last_updated":"2026-05-15T12:49:51Z","snapshot_observed_at":"2026-08-09T06:56:36.646396Z","submitted_at":"2026-04-28T21:29:03Z","title":"Application of Deep Reinforcement Learning to Event-Triggered Control for Networked Artificial Pancreas Systems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T14:51:30.263897Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.26126"},"observation_digest":"sha256:b9b02b68cf6cbbb63d97b53ee3a7ac12133515e8ca95b19255590d3c80e50d32","observation_id":"810aace4-d58a-49c6-85b6-0fb17d21ba16","resolution":{"observed_at":"2026-05-12T00:41:16.498617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2604.26126","last_updated":"2026-05-15T12:49:51Z","snapshot_observed_at":"2026-08-09T06:56:36.646396Z","submitted_at":"2026-04-28T21:29:03Z","title":"Application of Deep Reinforcement Learning to Event-Triggered Control for Networked Artificial Pancreas Systems","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T17:46:20.907461Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2604.26126"},"observation_digest":"sha256:828f3db3c666fce7ec9edcc51a4e3cab2e0455f4dbfce0d5965c27847487cba2","observation_id":"ec7d7e36-c90a-4688-b726-47c03e42b11c","resolution":{"observed_at":"2026-05-19T17:47:41.630296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.08665","last_updated":"2026-06-03T08:11:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:07:16Z","title":"Hint Tuning: Less Data Makes Better Reasoners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:13.146373Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.08665"},"observation_digest":"sha256:8ac44e4fdb63477935bb6c94b5e03bd41d84d053e4e54463e2d2959bf9680328","observation_id":"e5544742-6a92-4df8-8429-0affd16ea488","resolution":{"observed_at":"2026-05-12T08:36:26.341552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.08665","last_updated":"2026-06-03T08:11:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:07:16Z","title":"Hint Tuning: Less Data Makes Better Reasoners","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T23:34:43.785312Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.08665"},"observation_digest":"sha256:afdb84cf9192b9930ce754f6611174cbb8aa9953548016083584a50b999db7a3","observation_id":"2306338e-254c-4b5e-a92e-c19e3e962391","resolution":{"observed_at":"2026-06-30T23:35:07.063312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.11375","last_updated":"2026-05-12T00:58:42Z","snapshot_observed_at":"2026-08-08T13:07:17.510449Z","submitted_at":"2026-05-12T00:58:42Z","title":"TuniQ: Autotuning Compilation Passes for Quantum Workloads at Scale for Effectiveness and Efficiency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:20.040271Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.11375"},"observation_digest":"sha256:556a20137e2d3923a9827da944114e978ec19f1f7d5997329e6ad59c3e5fab3a","observation_id":"fd05a4da-3bbf-4276-a8e5-fcb36ddeedbf","resolution":{"observed_at":"2026-05-13T02:52:08.830825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.11473","last_updated":"2026-05-12T03:40:28Z","snapshot_observed_at":"2026-08-08T22:43:14.252060Z","submitted_at":"2026-05-12T03:40:28Z","title":"TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:13.679862Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.11473"},"observation_digest":"sha256:bca9c526ced1db82f58502f7b31728b474a2795320c70f50fad0c0ff640c7068","observation_id":"ed702539-4593-4c4c-9d30-38c779010c53","resolution":{"observed_at":"2026-05-13T01:52:05.744552Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.18591","last_updated":"2026-08-03T00:43:51Z","snapshot_observed_at":"2026-08-06T23:24:40.850221Z","submitted_at":"2026-05-18T16:05:36Z","title":"Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-20T12:44:29.147095Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.18591"},"observation_digest":"sha256:cc7d60860f47a0195078220261703f53d6837ab6867765d37af95722a1ea31c7","observation_id":"e8ccc653-d395-4959-978f-9d755b9a10bb","resolution":{"observed_at":"2026-05-20T12:48:17.499793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.30719","last_updated":"2026-06-26T17:52:03Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T01:24:24Z","title":"When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:38:33.520625Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.30719"},"observation_digest":"sha256:d82c0ab6a2285887546015ee5560abf618443718f67906393b32c69b37716285","observation_id":"4a2c263d-a5cb-48b1-aca4-b3c0ef4abb7b","resolution":{"observed_at":"2026-06-28T23:42:49.605925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2605.30719","last_updated":"2026-06-26T17:52:03Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T01:24:24Z","title":"When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:42:55.457904Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2605.30719"},"observation_digest":"sha256:3252b3d716b9eb6a0467da46d5f5b97508f5dafa433ec253f3b73fc0eaa6996f","observation_id":"4249dc2e-3a72-431a-b874-9af188867e0a","resolution":{"observed_at":"2026-06-29T05:43:07.739085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2606.17199","last_updated":"2026-06-15T18:37:51Z","snapshot_observed_at":"2026-08-08T14:44:03.594424Z","submitted_at":"2026-06-15T18:37:51Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T03:39:37.096675Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2606.17199"},"observation_digest":"sha256:4e4476931835e2d988c6bc1b7ee27edffb32939638f9a6c60956431bb5a1b001","observation_id":"ea047044-d8ca-484c-88d2-a6d70d7ccaf6","resolution":{"observed_at":"2026-07-03T17:48:46.310519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2606.23993","last_updated":"2026-06-27T11:51:16Z","snapshot_observed_at":"2026-08-03T03:39:13.981875Z","submitted_at":"2026-06-22T22:56:33Z","title":"Learning to Trigger: Reinforcement Learning at the Large Hadron Collider","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T08:35:33.377206Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2606.23993"},"observation_digest":"sha256:8443f3cf89ece6c797511298cd981a35281e37130e4c9cbdee980ed708598ba2","observation_id":"69add4d6-dddd-4560-a164-723cc1443895","resolution":{"observed_at":"2026-07-04T10:39:45.862272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2606.23993","last_updated":"2026-06-27T11:51:16Z","snapshot_observed_at":"2026-08-03T03:39:13.981875Z","submitted_at":"2026-06-22T22:56:33Z","title":"Learning to Trigger: Reinforcement Learning at the Large Hadron Collider","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T10:20:52.408426Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2606.23993"},"observation_digest":"sha256:1312ebdbddd67c92cd1a2a0524e17cb096e659c9a136e9f0f962fddbacf42381","observation_id":"ae2dde90-abce-4a0e-ae84-b3abf3babac2","resolution":{"observed_at":"2026-06-30T11:54:39.123007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":"2006.05990","doi":"10.48550/arxiv.2006.05990","metadata_source":"pith","pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters in on-policy reinforcement learning? A large-scal e empirical study","venue":"cs.LG","work_id":"67073b84-d283-4a63-ba53-c9e65061ec57","year":2020},"citing_paper":{"arxiv_id":"2607.07756","last_updated":"2026-07-08T14:01:16Z","snapshot_observed_at":"2026-08-02T22:53:58.003943Z","submitted_at":"2026-07-08T14:01:16Z","title":"The Importance of Encoder Choice:A Tabular-Image Study","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-07-10T19:03:32.353393Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2607.07756"},"observation_digest":"sha256:2f8a34e62fda57b4067d038542982f15f80e29dfec493f3451c1fc492802bd91","observation_id":"c078e5ea-f243-46fc-a542-efdd9bed50b0","resolution":{"observed_at":"2026-07-10T19:07:34.906671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2006.05990/citation-record","integrity":"/paper/2006.05990/integrity","json":"/paper/2006.05990/citation-record.json","paper":"/paper/2006.05990"},"outbound":[],"paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2006.05990."}