{"as_of":"2026-08-07T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8943d15b0e94e391a9b2e7744dc9e2681cdf21629ccbc75aab350e875df52fdc","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:44:33.680003Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13274/citation-record","integrity":"/paper/2607.13274/integrity","json":"/paper/2607.13274/citation-record.json","paper":"/paper/2607.13274"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:26.741095Z","title":"Mastering the game of Go without human knowledge.Nature, 550:354–359, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:26.741095Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:54b6570a0e9483f29fbb13bc7003c00d7035c3fa6d803c077c7bd844b039b7db","observation_id":"76181836-1d2f-4406-9fe1-d9a89c40dbb7","resolution":{"observed_at":"2026-08-02T05:44:26.741095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:26.833885Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:26.833885Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:c88978ab9dedaf9d078260732425ba716083e008da1b37d85156fe2fca63c1cd","observation_id":"59852375-7144-44d1-940a-20658f9d4847","resolution":{"observed_at":"2026-08-02T05:44:26.833885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:26.993836Z","title":"Wurman, Samuel Barrett, Kenta Kawamoto, James MacGlashan, Kaushik Sub- ramanian, Thomas J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:26.993836Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:ab78f64e2b707db0be74fbbdaaa9ba54d9119d53ce90d28f4c911dac26916a8f","observation_id":"e89e5b8a-40e7-454e-8148-cf1139b16432","resolution":{"observed_at":"2026-08-02T05:44:26.993836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.075781Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning.Nature, 602:414–419, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.075781Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:fd8c99085a3d5b4f252a92a082ae58b9674439e4a49b371f86d2c8cb5cea3844","observation_id":"b4607d67-9f1c-405d-9864-2c677e2bb66a","resolution":{"observed_at":"2026-08-02T05:44:27.075781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.097072Z","title":"Dense reinforcement learning for safety validation of autonomous vehicles.Nature, pages 620–627, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.097072Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:fa617ecaeee6f6c683e2ab520ab66ac11346c6123c46b9332e3ddb3eb117d64d","observation_id":"a1b5f11a-da62-4b10-b9cc-8799fa724a69","resolution":{"observed_at":"2026-08-02T05:44:27.097072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.195390Z","title":"A survey of reinforcement learning for software engineering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.195390Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:e0217162ef33a7007c1ef934eb89143fe9a55984b0743272a62af1108f675499","observation_id":"bd4bbc9d-398a-4ac5-9dea-54f8ae4f78b0","resolution":{"observed_at":"2026-08-02T05:44:27.195390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.356890Z","title":"Rainbow: Combining im- provements in deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.356890Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:0769cbe5d3dda56288ee72adeade5486278fe613c3bd4c0b67182508db9133d3","observation_id":"be714932-901a-4db4-9703-3cd568a0519d","resolution":{"observed_at":"2026-08-02T05:44:27.356890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.435167Z","title":"Noisy networks for exploration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.435167Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:5b82e9115698020e702d3aded1b58891a8220c7eb8c0cd98c980732375b21634","observation_id":"b4303a44-34aa-4d46-9466-6608155991e0","resolution":{"observed_at":"2026-08-02T05:44:27.435167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.574779Z","title":"A distributional perspective on rein- forcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.574779Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:bf70f1e8bc16e34c342bfe35454852e5316b17b36b02d0ebe039dc9b92495df3","observation_id":"a944e7ce-44de-48dd-8e4d-677ab55be01b","resolution":{"observed_at":"2026-08-02T05:44:27.574779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-02T05:44:27.738949Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.738949Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:0b231c81e2c7938cfd0c1a5f70aa97435f56e5d5dd3fd80b97b9e5e3e11304bc","observation_id":"22a7e2b2-29e6-4412-81de-81d1231e7b29","resolution":{"observed_at":"2026-08-02T05:44:27.738949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:27.913325Z","title":"The arcade learning environment: An evaluation platform for general agents.Journal of artificial intelligence research, 47:253–279, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:27.913325Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:a741ac5c78c681cef0fa49b694275f3a078c53ecea8450b58b751fc1a3a8720f","observation_id":"6b2a0f1c-0755-4013-b223-82f82ac2067a","resolution":{"observed_at":"2026-08-02T05:44:27.913325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.035495Z","title":"Revisiting rainbow: Promoting more insightful and inclusive deep reinforcement learning research","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.035495Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:6d4c6f1a5a56752bf4fa70dd8a3bddccab16a1f51bce741f1d5515e4edc2a935","observation_id":"fc7f2cef-3918-4a40-8a1c-d78b0d02dca5","resolution":{"observed_at":"2026-08-02T05:44:28.035495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.128592Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.128592Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:ce5abb41e721e5c4c8862927348dbc127c34c91815a37175681d775e7c224d32","observation_id":"8c522549-04fd-4eef-a2b6-25f6d23fa443","resolution":{"observed_at":"2026-08-02T05:44:28.128592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.296584Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.296584Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:a80e5c60045c61a068ab62746df5dd391e96da116ca6599c9ce438a95fb0bbe9","observation_id":"3622c9b4-b431-4b34-b57d-4232e433564d","resolution":{"observed_at":"2026-08-02T05:44:28.296584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-02T05:44:28.406736Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.406736Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:4f4ed7febdfec8bab1dc3d66994fa70478e413e5c1838f1b2b0effacf4aa2961","observation_id":"cb76570f-75c5-4c89-a37f-a6884f7e255b","resolution":{"observed_at":"2026-08-02T05:44:28.406736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.573897Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.573897Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:75700b2bfe785b1d7c746a55652bd6b1a0fe46bc65df2d250eb317c2d30aa71d","observation_id":"2d45eb03-2ba0-431c-8b8b-2cbc5e397cea","resolution":{"observed_at":"2026-08-02T05:44:28.573897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.703913Z","title":"Greedy actor-critic: A new conditional cross-entropy method for policy im- provement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.703913Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:2422852d71aaf8534b2a74f68ea5abbfa10bf0650a3fb22470a8cc47d544c2c2","observation_id":"48312fc9-f76d-4fdd-bcf4-8928084190ba","resolution":{"observed_at":"2026-08-02T05:44:28.703913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.820042Z","title":"Offline reinforcement learn- ing with tsallis regularization.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.820042Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:589524fd8c83fd9845cc789dd2233b60907e4f9768c21ae733692950194daeaf","observation_id":"2a8c6eac-f866-4e6a-b9bd-1ec76db9abd2","resolution":{"observed_at":"2026-08-02T05:44:28.820042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:28.938223Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:28.938223Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:09f7da144b50b818af050648da7c81e723ef5b759fca11ca35fa7fa93fee6fbd","observation_id":"381f5ffd-61bc-44c1-87d7-054c39b80524","resolution":{"observed_at":"2026-08-02T05:44:28.938223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T05:44:29.079070Z","title":"Proximal policy optimization algorithms.arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.079070Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:74be0f91732993e7891091b93504c3e2e708d6b9da42b0d444f74295c7beb9f2","observation_id":"67699977-a8ed-4fc4-8b97-8c5271e0a354","resolution":{"observed_at":"2026-08-02T05:44:29.079070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.216492Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.216492Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:e2489ce9ca45517f010790edae7129dab8f83cb28b6998a5f7babe3ed8e08844","observation_id":"fa2c6676-148b-487a-9451-0cb1bfcf320b","resolution":{"observed_at":"2026-08-02T05:44:29.216492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jece.2025","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:49:43.940242Z","title":"Al-Sakkari, Ahmed Ragab, Mohamed Ali, Hanane Dagdougui, and Daria C","venue":null,"work_id":"e84e3a82-6ac7-48cd-9dfe-0c271a7fffa7","year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.334558Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:990838d3cc6cc54769bc8294d90c6e8a1f850945eb0db5fe674ba7b3160cbab4","observation_id":"df7e68d9-646a-47fb-839f-9fbe7ba5a81f","resolution":{"observed_at":"2026-08-02T05:49:43.992833Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.442793Z","title":"Williams","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.442793Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:9204d0cb0d3ac4fcfdfa047d7b59a4d8e501af6a2c03882c05800c2916edafcc","observation_id":"f64d9506-0b65-41d6-b332-2b56207d0c84","resolution":{"observed_at":"2026-08-02T05:44:29.442793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.576781Z","title":"Rupam Mahmood, and Martha White","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.576781Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:8dfa306650af9b487759ca9374e181b016a21cac996548e539efc2f9e812bb54","observation_id":"b752b392-1d7b-4d64-96c2-a63a5491fb2a","resolution":{"observed_at":"2026-08-02T05:44:29.576781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.671054Z","title":"Mirror descent and nonlinear projected subgradient methods for convex optimization.Operations Research Letters, 31(3):167–175, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.671054Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:bd04f271cce8c8d8c38d9a634d00f3c6913217564656ef7c500f65bbc772abcb","observation_id":"58c5a498-9f74-4ba4-bb0b-37901f2ac260","resolution":{"observed_at":"2026-08-02T05:44:29.671054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.764860Z","title":"Investigating the utility of mirror descent in off-policy actor-critic","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.764860Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:47c8a30735faffeb8cf7de04f86d1344326b9d743a8dc4f2040f03dd6d678cde","observation_id":"8d621a94-4a8a-452b-9391-e1ab9efdc825","resolution":{"observed_at":"2026-08-02T05:44:29.764860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.907200Z","title":"Leverage the average: an analysis of regularization in rl","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.907200Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:771d49794f592bfb4da5cd2772945e3e1554ba22c86cedd2a26d6228d62a573f","observation_id":"04eecc7d-6ba6-4fde-ab13-d21ffb221b69","resolution":{"observed_at":"2026-08-02T05:44:29.907200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:29.989923Z","title":"Mirror descent policy optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:29.989923Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:95b07ded19d82461622561bd8e7566fe302eedb75f99f0844d600e5e30e6a915","observation_id":"67ac4cf5-be0f-41ff-afe9-1634ad231491","resolution":{"observed_at":"2026-08-02T05:44:29.989923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:30.108251Z","title":"Machado, Pablo Samuel Castro, and Nicolas Le Roux","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.108251Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:0f1be6a3450b2afd3ef27597421fb470ac1aa1185035c3645a7ef876b8810076","observation_id":"1e891a81-6264-431b-bb8d-46f584c05af3","resolution":{"observed_at":"2026-08-02T05:44:30.108251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:30.220660Z","title":"Approximately optimal approximate reinforcement learn- ing","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.220660Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:d380f3221a22726990bfbafcacaf19ad593bc0dd0f4c91e3d2091b46632fe129","observation_id":"6c47e1de-26fa-4673-b753-b9c88acda69e","resolution":{"observed_at":"2026-08-02T05:44:30.220660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:30.305447Z","title":"Revisiting mixture policies in entropy-regularized actor-critic","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.305447Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:f203f806140bb6db9c79a617a1203122f2174ac7036bf46779e4d8cc43318cef","observation_id":"17bad94f-2570-41c3-838c-93adbc75832e","resolution":{"observed_at":"2026-08-02T05:44:30.305447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:30.397569Z","title":"Improving stochastic policy gradi- ents in continuous control with deep reinforcement learning using the beta distribution","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.397569Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:cfabbe76f84afb807d91b3369fe94da0fd554f91f83a00d71f1dbd5a266c9d65","observation_id":"85a58543-8e10-4b50-9dc5-6e709fc0af7f","resolution":{"observed_at":"2026-08-02T05:44:30.397569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:30.553143Z","title":"Student-t policy in reinforcement learning to acquire global optimum of robot control.Applied Intelligence, 49(12):4335–4347, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.553143Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:334c0056296c8a9a8a0a93185181e98dbfb45573120549fabd4e353261f86bdd","observation_id":"0b2f2a20-a5d4-4ea3-9e12-233a9e2a24ad","resolution":{"observed_at":"2026-08-02T05:44:30.553143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:30.661370Z","title":"q-exponential policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.661370Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:18a07b7dff3a79581fd309be9189eccf8e9c94c475b644c07e7a4e1c80f605aa","observation_id":"cd677f8a-2668-4017-b1d8-b920c087939f","resolution":{"observed_at":"2026-08-02T05:44:30.661370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-06T08:45:25.937091Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-02T05:44:30.791324Z","title":"Policy representation via diffusion probability model for reinforcement learning.arXiv preprint arXiv:2305.13122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.791324Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:f9c005059850ddab176aa3c8833bed14b741713e7a735cc37523455f673ec96c","observation_id":"dd697e9d-b983-4464-8662-6d3bab226f82","resolution":{"observed_at":"2026-08-02T05:44:30.791324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-07-06T17:04:58.670142Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-02T05:44:30.881499Z","title":"Learning a diffusion model policy from rewards via q-score matching.arXiv preprint arXiv:2312.11752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:30.881499Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:40c665c82974055ebb5ab8a89e1584f0564fc8d778c8dc8d7ebd5173300946fb","observation_id":"131fc597-58d5-4fb6-a993-89847e6b741a","resolution":{"observed_at":"2026-08-02T05:44:30.881499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.053462Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy opti- mization.Advances in Neural Information Processing Systems, 37:53945–53968, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.053462Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:a9c607a14c8f75a76a7c6ba8930bbe5cc92105f849bd13e9b6a24a6de528026e","observation_id":"ebf78c45-fe66-4109-8457-dbd017bb2122","resolution":{"observed_at":"2026-08-02T05:44:31.053462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.165487Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.165487Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:7be437040f7179b5b8aaaf86bf56cb09d844c85a8394d316fb93f67f432468f6","observation_id":"73ccc44a-1e9e-4a18-bb03-ac97bfc23d00","resolution":{"observed_at":"2026-08-02T05:44:31.165487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.253418Z","title":"Sampling from energy- based policies using diffusion.Reinforcement Learning Journal, 6:2291–2307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.253418Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:8a34522b627101c5b2d3a3e9154c8085d76bb6036dbd102cd12df93a48939d06","observation_id":"7117d35f-2783-43b5-9836-874abf3dd5ca","resolution":{"observed_at":"2026-08-02T05:44:31.253418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.339763Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.339763Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:9fc33d21bbcc691cb3808df77123f176e6f777e56280d62e23e67441ed0de8d4","observation_id":"36910a57-7546-4778-8251-6b6599474f86","resolution":{"observed_at":"2026-08-02T05:44:31.339763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.453906Z","title":"Addressing the plasticity- stability dilemma in reinforcement learning.arXiv preprint arXiv:2512.01034, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.453906Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:17c6faac125428718a8c5ff5acfb5316c3befcc857465c319b8c1d025c1636c2","observation_id":"f7108f00-a3e7-4df8-bfb1-436926ae75dd","resolution":{"observed_at":"2026-08-02T05:44:31.453906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.578005Z","title":"Sample-efficient reinforcement learning by breaking the replay ratio barrier","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.578005Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:7bd1abd29306aff7f43f49750adfadc5644cc41b88f0495efcff04263f02dfcf","observation_id":"842181b4-1d58-46be-9e82-a2bf4e6ed9a1","resolution":{"observed_at":"2026-08-02T05:44:31.578005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.692429Z","title":"Mad-td: Model-augmented data stabilizes high update ratio rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.692429Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:ef122d45ee5a28b6d7570016045fc10f97ad20f6b8bb17575b58229c0307825f","observation_id":"41ce20f4-2251-4e64-8f52-c79e484116cb","resolution":{"observed_at":"2026-08-02T05:44:31.692429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:31.868372Z","title":"Stochastic approximation with two time scales.Systems & Control Letters, 29(5):291–294, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:31.868372Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:315ead79791091566345b65645f060b26947c5b82a076f85e626c52e6480d4d0","observation_id":"818b023d-dd62-452f-98d8-fb451027ef8b","resolution":{"observed_at":"2026-08-02T05:44:31.868372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:32.067957Z","title":"Actor-critic algorithms.Advances in neural information processing systems, 12, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.067957Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:09d04224c0f9eb8a32b7f6e9097eae2e54af7ad74b960d1413efbaa2a9fdf63f","observation_id":"391ac6bd-0c48-4198-b938-9b9795d6df0e","resolution":{"observed_at":"2026-08-02T05:44:32.067957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:32.204583Z","title":"Sutton, Mohammad Ghavamzadeh, and Mark Lee","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.204583Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:87c30c09f5e37ff3b76875d832bc90c2335108ec4783d57ca6c6d5b10abfa1fa","observation_id":"71942004-296b-4e93-b1df-62a99b4bff43","resolution":{"observed_at":"2026-08-02T05:44:32.204583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:32.415091Z","title":"Likelihood ratio gradient estimation for stochastic systems.Communications of the ACM, 33(10):75–84, 1990","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.415091Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:09ec7e7b86960e0757c422c20562f8aa29ce14e96d10a18580580cce9fde8571","observation_id":"fe2f7147-e909-46e6-9b9a-7582c394ff28","resolution":{"observed_at":"2026-08-02T05:44:32.415091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-02T05:44:32.555808Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.555808Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:20f6f14d26f33acd76b827a61dd515593c91855304e28af77b30b9fb6962c58e","observation_id":"f0394865-a082-433e-8b6f-e4fe874cabba","resolution":{"observed_at":"2026-08-02T05:44:32.555808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-02T05:44:32.660438Z","title":"Categorical reparameterization with gumbel- softmax.arXiv preprint arXiv:1611.01144, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.660438Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:9c4a5591e6acf127cd2ed48717fed1b9982e4f9bb31fbdc8a7ecdebb8e16e4a6","observation_id":"b96b1259-a825-477f-8179-6e7d8912837f","resolution":{"observed_at":"2026-08-02T05:44:32.660438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:32.780673Z","title":"Variance reduction properties of the reparameterization trick","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.780673Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:eda3dba0303c59b604fa5b9131fd1d489d7825eb202c507f7d8a71a5b38d942c","observation_id":"f7eea0fb-51a1-4c6b-b58b-f27c934d7922","resolution":{"observed_at":"2026-08-02T05:44:32.780673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:32.920408Z","title":"Pipps: Flexible model-based policy search robust to the curse of chaos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:32.920408Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:c3422e11f5eadc392471fa5de0576c47bc9b48fed0a7f33902f27e55cfc463d9","observation_id":"45bf848a-18c9-400a-8924-47603f8b1aa6","resolution":{"observed_at":"2026-08-02T05:44:32.920408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:33.087488Z","title":"Pid controllers: theory, design, and tuning.The international society of measurement and control, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:33.087488Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:b02149414f918aef763565b146fdbb438b99570b5ff1c5dafa68acde38b49769","observation_id":"0329d157-f071-4f2d-9fc5-0fdf011a2e18","resolution":{"observed_at":"2026-08-02T05:44:33.087488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:33.268132Z","title":"Fat-to-thin policy optimization: Offline rl with sparse policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:33.268132Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:c7f5f9f9e835edc15e9f85958763b080b8de18708648faf8344cb658a16971ae","observation_id":"9a40193e-c5ad-48bd-8820-0d92e43bef11","resolution":{"observed_at":"2026-08-02T05:44:33.268132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:33.396253Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:33.396253Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:51e8f713903c11452934ba86614615a1efda3cc0a8d4b0df0f2f4a463f3987e6","observation_id":"c3b3a3fa-98cb-47df-98ab-0bc9931f7baa","resolution":{"observed_at":"2026-08-02T05:44:33.396253Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:33.521780Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:33.521780Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:ad3c0b23c6c0aa72a7f09eaebf2762f63a991be0f68b87e096f2f23f94ecb3c9","observation_id":"8bb9d238-ec1c-4719-8711-5b07d498252d","resolution":{"observed_at":"2026-08-02T05:44:33.521780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:44:33.680003Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:44:33.680003Z"},"links":{"citing_paper":"/paper/2607.13274"},"observation_digest":"sha256:0ba13fcf9ce70f3b5424fe6345cc4a88cd9a2bc0726664a9c9e518ae8aeeb91a","observation_id":"35dea39d-dfa5-42d1-b459-eb75807c0839","resolution":{"observed_at":"2026-08-02T05:44:33.680003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13274","last_updated":"2026-07-14T21:20:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T06:03:56.456872Z","submitted_at":"2026-07-14T21:20:42Z","title":"Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.13274."}