{"as_of":"2026-08-16T22:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ee1065d540b8ca02005e8f33bae153a7022aaf21fedad13b651f65276f36c9c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:31:05.142660Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07086/citation-record","integrity":"/paper/2608.07086/integrity","json":"/paper/2608.07086/citation-record.json","paper":"/paper/2608.07086"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.825882Z","title":"Deep reinforcement learning at the edge of the statistical precipice.Advances in Neural Information Processing Systems, 2021","venue":null,"work_id":"211031da-aaad-4250-9d65-5532c82a8000","year":2021},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.001933Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:959f8f94ee7f817fec0a4c2f8afea71c06c1803c3d31ec33f100ff2ff2d3ff54","observation_id":"7b645c31-9859-436c-b7ad-91e7c44f0365","resolution":{"observed_at":"2026-08-15T14:31:05.830406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.006890Z","title":"PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transformation and Graph Compilation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.006890Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:102b38b09d060ab56b894dea9ca1c126aef4e6af65b766658fd3a77b6408a11b","observation_id":"a71db8cf-97de-4be7-8d0a-4350e0effaef","resolution":{"observed_at":"2026-08-15T14:31:05.006890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.5538","last_updated":"2014-04-23T11:48:51Z","snapshot_observed_at":"2026-08-15T00:55:35.699171Z","submitted_at":"2012-06-24T20:51:38Z","title":"Representation Learning: A Review and New Perspectives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.5538","snapshot_observed_at":"2026-08-15T14:31:05.010898Z","title":"Representation learning: A review and new perspectives, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.010898Z"},"links":{"cited_paper":"/paper/1206.5538","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:7985a1b3faf4fe9648cb1c8d21a802c479c63e793bd9d813159f20e8c7cba32c","observation_id":"5cc07015-ee2e-4b2d-b84d-dbc3a1c4fab9","resolution":{"observed_at":"2026-08-15T14:31:05.010898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.812880Z","title":"Revisitingrainbow: Promotingmoreinsightful andinclusivedeepreinforcementlearningresearch","venue":null,"work_id":"46006dd1-c5e9-432b-9618-61f1773dfeb3","year":2021},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.016231Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:3294181db67f6d476bb4a5887bbd5b575696fad33c89846ce98d6462ae551df3","observation_id":"f7c176e3-440d-42da-b1f1-e688d0d61fc8","resolution":{"observed_at":"2026-08-15T14:31:05.817149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.799665Z","title":"Beyond the rainbow: High perfor- mance deep reinforcement learning on a desktop PC","venue":null,"work_id":"c95f53af-ca7a-4c06-a112-7904c006202e","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.020565Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:6fe018ed9993c86a82e6729230258a57538263adc0fcbe9f170b89024bc45757","observation_id":"55b224c6-c5f6-490a-9dc5-48842f814911","resolution":{"observed_at":"2026-08-15T14:31:05.803930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.06700","last_updated":"2020-07-13T21:22:17Z","snapshot_observed_at":"2026-08-15T11:08:35.763114Z","submitted_at":"2020-07-13T21:22:17Z","title":"Revisiting Fundamentals of Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.06700","snapshot_observed_at":"2026-08-15T14:31:05.024537Z","title":"Revisiting fundamentals of experience replay, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.024537Z"},"links":{"cited_paper":"/paper/2007.06700","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:008c887c3d1e82c8292b3eba23538804883f5d59dbf5a4ff8dacb2f471507764","observation_id":"a2d0ff16-9a26-45c0-82a9-88788c052046","resolution":{"observed_at":"2026-08-15T14:31:05.024537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.786931Z","title":"An equivalence between loss functions and non-uniform sampling in experience replay.Advances in Neural Information Processing Systems, 33,","venue":null,"work_id":"cb3118e3-daf3-47db-837f-cc3053404558","year":null},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.029479Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:7dfcfdfad652f047884df12c59a2299bb6b7b6f7c94ca9b60939ca64cce506cd","observation_id":"18f84dbe-49c6-41ac-a648-658a38c48b85","resolution":{"observed_at":"2026-08-15T14:31:05.791033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.774202Z","title":"Smith, Shixiang Shane Gu, Doina Precup, and David Meger","venue":null,"work_id":"108fdc79-cce2-4d21-8321-91b09532e580","year":2023},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.033872Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:e7b2f50cb2e686a7d7dc7e5b7e686d7d1f9721386faeb06e79ab623449d52d55","observation_id":"ba8afdf8-a6dd-497e-b95a-3865bba1c3a7","resolution":{"observed_at":"2026-08-15T14:31:05.778291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.760530Z","title":"Towards general- purpose model-free reinforcement learning","venue":null,"work_id":"5e176e40-8321-4662-a617-e4dda8433ecd","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.037718Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:5760ddaae78a3d7dc59823760c5ef0c03b0fa103b09ec32f262f3ccf745e2b82","observation_id":"114a4593-5437-4a6a-b95c-95c297cbd53c","resolution":{"observed_at":"2026-08-15T14:31:05.764984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.747243Z","title":null,"venue":null,"work_id":"15d5a74b-2819-4b19-9701-9ea155fe90b2","year":2023},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.042750Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:ab358825388cf9d1c50cbc2c7fad43608f71f1c77225a97362086c1c683501b9","observation_id":"198838a9-a1ee-4b99-b3f1-36f25938948d","resolution":{"observed_at":"2026-08-15T14:31:05.751431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.046493Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.046493Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:0c1cdb2535ddf1562445d05981b86fffff3278b4dd132e4720363fbd4d9eb1cd","observation_id":"b0424f19-834a-4528-ad26-79e415c6cc07","resolution":{"observed_at":"2026-08-15T14:31:05.046493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.734318Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"5d28b57e-52f7-428c-ac7c-4b33e90090fd","year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.050311Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:8b389f9a13000549eb983863b30ebdb90c1141557e5710b49733a6d79f0e1bc2","observation_id":"6f7029ca-cfb7-4d49-8b67-7b6183bc9427","resolution":{"observed_at":"2026-08-15T14:31:05.738365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.721312Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":"b79cb6d9-f70c-4610-9d0e-07617f5a2617","year":2020},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.054111Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:07d8e6abd9ef5474fa105afdee1c35b8af370ba9669def29146e9864ca4febc3","observation_id":"b9b0687c-193a-4f11-acb9-2980ee440fc7","resolution":{"observed_at":"2026-08-15T14:31:05.725965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.708356Z","title":"Td-mpc2: Scalable,robustworldmodelsforcontinuous control","venue":null,"work_id":"14dd74da-781f-4c41-9f90-e0d2e61d0fb3","year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.057874Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:51dde7d465aaf4204bc1a69fec5af1e4b38d41adc0c00a75128c0cc589abfe10","observation_id":"4a5a9464-f724-4d99-b55e-565db405084a","resolution":{"observed_at":"2026-08-15T14:31:05.712833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.694890Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"daeb678e-9e3e-49a4-bac0-1681e5114196","year":null},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.062036Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:751643e6f31c525b07c4fcf2590c2ae7fbd96f9cfb7c79700505c08f523015c8","observation_id":"75521aa7-6adf-44cc-a9fc-4f6f63778aea","resolution":{"observed_at":"2026-08-15T14:31:05.699017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04832","last_updated":"2026-04-18T13:11:19Z","snapshot_observed_at":"2026-08-07T20:09:01.472991Z","submitted_at":"2024-11-07T16:13:54Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04832","snapshot_observed_at":"2026-08-15T14:31:05.065783Z","title":"Plasticity loss in deep reinforcement learning: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.065783Z"},"links":{"cited_paper":"/paper/2411.04832","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:8fef368355b1ac344147bf1c8b77ecd1b6d64e6db8c06c83e3dc82c5c859bd8e","observation_id":"5edb7225-8d95-4cf5-93a0-1e30b94bf0a9","resolution":{"observed_at":"2026-08-15T14:31:05.065783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.682276Z","title":"Mastering massive multi-task reinforcement learning via mixture-of-expert decision transformer","venue":null,"work_id":"170830ff-b015-4f7d-aada-b8408c38352b","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.069668Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:8ada072ccb2b6b2566454e207c456f2818f708656e8e3ca10b856408e092ab7b","observation_id":"9dabe8db-d422-4f46-a02e-93d1151f35b2","resolution":{"observed_at":"2026-08-15T14:31:05.686469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.655926Z","title":"QPO: Query-dependent prompt optimization via multi-loop offline reinforcement learning.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"abf50021-3392-48dc-98dd-fc025b73aedd","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.078419Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:8c0c71b9daf30ed9293f7dcabeef14af7348b808393aa59096bc653ac5966056","observation_id":"53a4a274-5cb8-4031-b1bf-7753a63c9128","resolution":{"observed_at":"2026-08-15T14:31:05.660678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.643302Z","title":"Large batch experience replay, 2021","venue":null,"work_id":"c193379a-fff5-4e45-91cd-4e82049d2a29","year":2021},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.082448Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:944bf888e811dcc5e0ec1a842f73b14abf2f5b3afa1b2eb2c8f01007d47a966c","observation_id":"319fb73b-2c66-47d1-b57c-ff3b3b2d30a4","resolution":{"observed_at":"2026-08-15T14:31:05.647586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.629793Z","title":"Wurman, Jaegul Choo, Peter Stone, and Takuma Seno","venue":null,"work_id":"6a712207-5159-4f52-a2ff-9598de533bda","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.085958Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:4fc1e673e50ba1fe679da7becf60b29d73a4b3221c8c895acc1598ee79e95b54","observation_id":"cdcacc60-feda-444a-834f-e39b00bab801","resolution":{"observed_at":"2026-08-15T14:31:05.634494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.616194Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":"8b90670f-e115-45d4-adcb-49b02da1e267","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.089803Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:686690444f9d0516686152260e9bdd88fecf6ba265c266925a2ed9200c57b0c5","observation_id":"1c377562-335d-4156-a0eb-9dc78448d871","resolution":{"observed_at":"2026-08-15T14:31:05.620487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12096","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.381602Z","title":"Rethinking the role of dynamic sparse training for scalable deep reinforcement learning, 2025","venue":null,"work_id":"eb51def4-e43b-4f12-83db-e656c540eb6c","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.093033Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:4bbcb13d5779557307c658917ef7ff402c978fe708faeac2222f5320baee098c","observation_id":"4b4e2654-1194-4ec2-9809-600e16731e56","resolution":{"observed_at":"2026-08-15T14:31:05.388872Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.602888Z","title":"Mahankali, Zhang-Wei Hong, Ayush Sekhari, Alexander Rakhlin, and Pulkit Agrawal","venue":null,"work_id":"8d677c78-724b-4614-9e6a-ae685b0db499","year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.097064Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:8cf8fda9a741fd884071fc545310eac5f124b4ddb88683f132738f59ddbd4c25","observation_id":"0b3d14d8-c749-46db-8cfd-92fab8f3f293","resolution":{"observed_at":"2026-08-15T14:31:05.607191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-16T13:49:30.634028Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-15T14:31:05.100698Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.100698Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:be508eef0c3d0cfb97d973525b006a56c4bb7707476bb01aa19170402dd2fb22","observation_id":"214917d2-f8fb-4d65-8fea-3b5a87a08529","resolution":{"observed_at":"2026-08-15T14:31:05.100698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.589633Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"2cc775c8-6dc1-49e6-9231-a353007892ab","year":2022},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.104762Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:391ae01ae522adf2b6ba0091431f73582ef211810df0ca0fb17b53584311c5b1","observation_id":"2569f3ca-d3d4-4a04-a81e-6035a01de763","resolution":{"observed_at":"2026-08-15T14:31:05.593965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-15T14:31:05.109114Z","title":"Prioritized experience replay.arXiv preprint arXiv:1511.05952, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.109114Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:efe6ea4b33a87834c5fe966f1eb01ea3c38dbb8980fb48e5e8e053f7f2df2e85","observation_id":"69a707fb-f985-4874-927a-b6bb18f8cca8","resolution":{"observed_at":"2026-08-15T14:31:05.109114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-16T14:09:21.685692Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-15T14:31:05.113954Z","title":"Humanoid- bench: Simulated humanoid benchmark for whole-body locomotion and manipulation.arXiv Preprint arxiv:2403.10506, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.113954Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:a4213fcdffb832b7c84a6e350144eb0244e23728186f54e93895f931515713f0","observation_id":"8baa9996-7acb-4b10-893b-254deb7763dd","resolution":{"observed_at":"2026-08-15T14:31:05.113954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04136","last_updated":"2020-09-21T15:34:30Z","snapshot_observed_at":"2026-08-14T23:15:23.495239Z","submitted_at":"2020-04-08T17:40:43Z","title":"CURL: Contrastive Unsupervised Representations for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04136","snapshot_observed_at":"2026-08-15T14:31:05.118443Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.118443Z"},"links":{"cited_paper":"/paper/2004.04136","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:d885fed4029c03470aefc189c18a02750baf8c7d8f3f61b2d52b3249bd7350c5","observation_id":"06849875-f7d8-46b1-a0aa-5e34fec23a11","resolution":{"observed_at":"2026-08-15T14:31:05.118443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10483","last_updated":"2023-11-01T15:06:08Z","snapshot_observed_at":"2026-08-16T16:37:38.344888Z","submitted_at":"2022-08-22T17:55:43Z","title":"Prioritizing Samples in Reinforcement Learning with Reducible Loss","version":3},"cited_work":{"arxiv_id":"2208.10483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.10483","snapshot_observed_at":"2026-08-15T14:31:05.222447Z","title":"Prioritizing Samples in Reinforcement Learning with Reducible Loss","venue":"cs.LG","work_id":"0bbf41f2-e479-4084-9951-9dde783383ed","year":2022},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.123358Z"},"links":{"cited_paper":"/paper/2208.10483","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:f829714fb2bd1d66141e857959ad46e0d3ab994f712c6b11185da88891f4df21","observation_id":"06d296aa-09b2-4fc3-aa9d-c15e9bbee99f","resolution":{"observed_at":"2026-08-15T14:31:05.229660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.576822Z","title":"MaxinfoRL: Boosting exploration in reinforcement learning through information gain maximization","venue":null,"work_id":"123ff4c8-e446-44f0-b3d5-2e45a0ec9616","year":2025},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.128069Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:869876896bf6f30159a329f271e64ae8bdb2f32b75f2f5476b56917abf0d23fe","observation_id":"1f82b7ca-3752-4d2f-b1cd-af5539c2c183","resolution":{"observed_at":"2026-08-15T14:31:05.580941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T14:31:05.133424Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.133424Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:5591ebcc95d3fa72fa4cadb86acb824da3d758ff64383717ad7e1a24aac6d801","observation_id":"9976e6e9-1ab3-4df9-a4b3-ea6db16b9e2e","resolution":{"observed_at":"2026-08-15T14:31:05.133424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13600","last_updated":"2022-05-26T20:11:23Z","snapshot_observed_at":"2026-08-16T16:57:22.239854Z","submitted_at":"2022-05-26T20:11:23Z","title":"MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13600","snapshot_observed_at":"2026-08-15T14:31:05.138058Z","title":"Myosuite – a contact-rich simulation suite for musculoskeletal motor control.https://github","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.138058Z"},"links":{"cited_paper":"/paper/2205.13600","citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:8e2def90c9955a5dd374f2ac066bea51c43b71e8dc0c08e317693c5107e6f853","observation_id":"5fe39764-39e3-424f-b0ed-7278b0939307","resolution":{"observed_at":"2026-08-15T14:31:05.138058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.564728Z","title":"Towards sample efficient reinforcement learning","venue":null,"work_id":"a3e27ccd-c50d-4be2-ae78-3a7bfc10488d","year":2018},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.142660Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:9579a36ee3c4d08dc763fa1f17733abb8c2190fb592679bc398899b33556a157","observation_id":"4c5b25b3-c1e9-4c35-9c75-c2b123dd9bd7","resolution":{"observed_at":"2026-08-15T14:31:05.568934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:31:05.669641Z","title":null,"venue":null,"work_id":"f8c91fdb-0d45-4578-9354-a6fe2fee34fe","year":null},"citing_paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:31:05.073893Z"},"links":{"citing_paper":"/paper/2608.07086"},"observation_digest":"sha256:d940d85cad8e710a142092ab10974a660e55d477b512c5ae5e52dcb258756ff7","observation_id":"b2c3eb7a-f0ca-48c1-a217-f1132a55ecc6","resolution":{"observed_at":"2026-08-15T14:31:05.673659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07086","last_updated":"2026-08-07T10:38:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:57:49.166878Z","submitted_at":"2026-08-07T10:38:31Z","title":"Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.07086."}