{"as_of":"2026-08-20T21:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79da711837c208bbc7bde68f9a6d4c465e7520655cb25553dd95d691ad8cec55","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:28:00.234115Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02910/citation-record","integrity":"/paper/2507.02910/integrity","json":"/paper/2507.02910/citation-record.json","paper":"/paper/2507.02910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.654220Z","title":"a uble, Anirudh Goyal, Alexander Neitz, Manuel W \\","venue":null,"work_id":"0ee97236-644e-4548-ab0f-be9262bcaebf","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.095120Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:c95d6d953d824352ebb7ca3cf3bbb50aa64820db40ceec99ffd369702667bc07","observation_id":"953a5292-6c7d-4371-88bc-577fd9145fcb","resolution":{"observed_at":"2026-08-15T18:28:00.658054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.642588Z","title":"Woulda, coulda, shoulda: Counterfactually-guided policy search","venue":null,"work_id":"8eb9b5d4-7d3c-4427-b78c-90b0493453ec","year":2018},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.099700Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:d5da0a02cb3f5e27d986d20edf24aa4cc992b943e8d4bff5385e58ba22cda457","observation_id":"6c7324e0-89ef-4b0d-a93b-2243831feac8","resolution":{"observed_at":"2026-08-15T18:28:00.647177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.631896Z","title":"Minimalistic gridworld environment for gymnasium","venue":null,"work_id":"92f0666c-d20b-455e-b61e-0e35b5690a45","year":2018},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.103304Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:bc9974a25e7c5dca762f7b56604798957a52869386481dc6ba78f2e846101b66","observation_id":"1bed28bd-fd9f-4e9f-b2ca-6da690a50cfa","resolution":{"observed_at":"2026-08-15T18:28:00.635425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.621633Z","title":"Diversify & Conquer : Outcome-directed curriculum rl via out-of-distribution disagreement","venue":null,"work_id":"e6eb759b-26d6-4280-82ba-416d2e58bd61","year":2023},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.107074Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:0722d0d8b2ebf480194c8b818b575f84ad3387a407efa5ca3a455215034b177f","observation_id":"0e23d3de-29a1-4e09-88fb-d08b763b5ab9","resolution":{"observed_at":"2026-08-15T18:28:00.625212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11741","last_updated":"2023-02-20T07:47:40Z","snapshot_observed_at":"2026-08-16T15:59:42.474185Z","submitted_at":"2023-01-27T14:25:04Z","title":"Outcome-directed Reinforcement Learning by Uncertainty & Temporal Distance-Aware Curriculum Goal Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11741","snapshot_observed_at":"2026-08-15T18:28:00.111372Z","title":"Outcome-directed reinforcement learning by uncertainty & temporal distance-aware curriculum goal generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.111372Z"},"links":{"cited_paper":"/paper/2301.11741","citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:aac502af775df475eb54ecd28f32ba38ab5404534e70b6004bf25f9a04288efc","observation_id":"db015b49-98b3-4443-b897-8fcd5b93efb3","resolution":{"observed_at":"2026-08-15T18:28:00.111372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.610571Z","title":"Reverse curriculum generation for reinforcement learning","venue":null,"work_id":"55db1aad-063d-408c-a39b-c52e16a60e07","year":2017},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.115789Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:62993b49832c5c8b7086e54b93e359c794f86e9014f20ebf0e521e3a83d8fdba","observation_id":"2be97a85-b39f-453d-8057-158cf1034f21","resolution":{"observed_at":"2026-08-15T18:28:00.614584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.598686Z","title":"Automatic goal generation for reinforcement learning agents","venue":null,"work_id":"f2428674-1a70-475f-9980-1c82226d13f8","year":2018},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.120131Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:dc82e8a55a2739432f10457e390e688ec6cec968b24329410c94c078f02817ac","observation_id":"794300e6-4310-49fc-8f20-d08e2c9a51d8","resolution":{"observed_at":"2026-08-15T18:28:00.602822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.587130Z","title":"Automated curriculum learning for neural networks","venue":null,"work_id":"af791d3d-888f-48f4-ba86-9aeb2aa5c800","year":2017},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.123783Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:3dfa4e9b56bad4904a6c5ff2ed18878291ea84c17df092e3b01d8e213670102a","observation_id":"4e8ee641-9dac-4d7d-a70f-b2ad73ca145b","resolution":{"observed_at":"2026-08-15T18:28:00.591413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.02259","last_updated":"2015-02-08T14:58:50Z","snapshot_observed_at":"2026-08-14T23:00:56.212471Z","submitted_at":"2015-02-08T14:58:50Z","title":"Contextual Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.02259","snapshot_observed_at":"2026-08-15T18:28:00.127323Z","title":"Contextual markov decision processes","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.127323Z"},"links":{"cited_paper":"/paper/1502.02259","citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:1f1e304c87114c910a160a0adb2e5e657dfff68f66451a9cbefb10318996b395","observation_id":"27db7a0c-8fac-4691-a8cb-ebd12f9156e4","resolution":{"observed_at":"2026-08-15T18:28:00.127323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.131004Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.131004Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:ddc924770ef2cf58e0eae69b67d1818c6abfcfac513556882dbe0d7d3e82a878","observation_id":"cd2614d0-133a-4417-879b-d0fc4e380079","resolution":{"observed_at":"2026-08-15T18:28:00.131004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.569853Z","title":"Curriculum reinforcement learning using optimal transport via gradual domain adaptation","venue":null,"work_id":"6cbc3517-11fb-40a8-ad4d-1323861bb215","year":2022},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.134347Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:c6dc2eb8b953680c115d054920204eeb41be1725db5ceb38949ad49b5f2f64af","observation_id":"fc910c00-1ee0-4be4-97e9-24fca63e034f","resolution":{"observed_at":"2026-08-15T18:28:00.573402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04268","last_updated":"2024-06-06T17:15:02Z","snapshot_observed_at":"2026-08-18T04:12:42.533064Z","submitted_at":"2024-06-06T17:15:02Z","title":"Open-Endedness is Essential for Artificial Superhuman Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04268","snapshot_observed_at":"2026-08-15T18:28:00.138115Z","title":"Open-endedness is essential for artificial superhuman intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.138115Z"},"links":{"cited_paper":"/paper/2406.04268","citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:89a21a929ec2615e55078345f94e11e7455a7898e2999b02a2267c810a70af69","observation_id":"9583bc91-9a19-4914-90f3-5dcc2b8f1d9e","resolution":{"observed_at":"2026-08-15T18:28:00.138115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.559875Z","title":"Prioritized level replay","venue":null,"work_id":"644aaa87-e741-4132-9a6a-d0453842b5e3","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.141753Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:a6082b29ef6e96ae1df309eacbe1b7061bf0ce4120b43dc839521fcc13f826e2","observation_id":"f0adc7aa-b4f8-472e-afe2-03d70e358e20","resolution":{"observed_at":"2026-08-15T18:28:00.563254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.549796Z","title":"Self-paced contextual reinforcement learning","venue":null,"work_id":"7ff643d6-3a57-4cba-9589-85178ec7c817","year":2020},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.144998Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:880ea7f3c5bd446551bb7827a3d1229ec989b7da4acc4725aa5f3fc192327734","observation_id":"f6e17f3c-e2ca-4636-b75f-416d2fa7e48e","resolution":{"observed_at":"2026-08-15T18:28:00.553152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.539942Z","title":"Self-paced deep reinforcement learning","venue":null,"work_id":"659ca842-d82b-418d-814a-56a9a051a7f2","year":2020},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.148325Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:d09dc67c989a991f5ce277cd1ca29702975ddd6edb705d612569f2a3eab4aa77","observation_id":"21b678b9-88e7-44f4-8897-96381d278f48","resolution":{"observed_at":"2026-08-15T18:28:00.543308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.529800Z","title":"A probabilistic interpretation of self-paced learning with applications to reinforcement learning","venue":null,"work_id":"05621148-2751-480b-9275-03c9bd45528e","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.151901Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:0a3c56df06895466e099267ff7b71541da8d9985fbad1d8a67916301650f46c1","observation_id":"73304e73-c5a3-46b4-b0f1-58a9246d327a","resolution":{"observed_at":"2026-08-15T18:28:00.533185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.518943Z","title":"Boosted curriculum reinforcement learning","venue":null,"work_id":"8646dc48-64d4-4db6-8401-f68641c617a5","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.155527Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:142d44f668dfa95fc28991c797bafce6fb87da895617eaa2af5802610d67e30f","observation_id":"0dcb690d-54d6-4441-b158-968a52cfabe9","resolution":{"observed_at":"2026-08-15T18:28:00.523176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.507921Z","title":"Curriculum reinforcement learning via constrained optimal transport","venue":null,"work_id":"124012a4-38d5-4474-a4e7-d6f05a6701a0","year":2022},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.159168Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:2f1864ddad0d39951db49933e8f01e6c483a6975db3f6530ee5d01856fae56ba","observation_id":"fb45d039-8a02-4299-a041-3bfc9689026b","resolution":{"observed_at":"2026-08-15T18:28:00.511917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.497716Z","title":"On the benefit of optimal transport for curriculum reinforcement learning","venue":null,"work_id":"3420dcca-c2d6-4c6c-a8b1-8fbba277d2c2","year":2024},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.162905Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:916878a7ad8047965d4005b0267e9c7428dc6a4c7232729fae6da0340bee8a85","observation_id":"a2b823b1-918a-4fc7-8dc3-ccf524bf7610","resolution":{"observed_at":"2026-08-15T18:28:00.501400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.487952Z","title":"Causally aligned curriculum learning","venue":null,"work_id":"fb12bb19-ff5f-40c8-a248-22babd2f58f8","year":2024},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.166567Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:4b9db72334cc63991ea7902532225541298017b2296da87379bbb4002250936f","observation_id":"9b442bf2-1f8a-4de4-9533-00afd1098e7c","resolution":{"observed_at":"2026-08-15T18:28:00.491499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.478009Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey","venue":null,"work_id":"d244d177-b700-46c6-aa99-6202beeff4b6","year":2020},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.170102Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:4b903962f4522d59fcdc68bc3455229e9c9ac24ae542cb50a4d33d681b838cfc","observation_id":"3de08546-1ea3-4db5-906c-6662678c9f54","resolution":{"observed_at":"2026-08-15T18:28:00.481440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.467998Z","title":"Evolving curricula with regret-based environment design","venue":null,"work_id":"245ab75d-e7d4-4b85-9c29-c1e2abd95bfb","year":2022},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.173311Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:f6ac7eca337ffcc4c32527a01379385c9304cd713fc5d9e626131b2315bf0d60","observation_id":"de855b34-d9e9-47a4-80ef-e6cd027584a3","resolution":{"observed_at":"2026-08-15T18:28:00.471535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.176739Z","title":"Causality: Models, Reasoning, and Inference","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.176739Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:ecfb25f18baf2a4d9ae850c132cc3971369d52861c9013aa3514019841528c24","observation_id":"6d570a05-182e-4bda-9476-09d304dd4332","resolution":{"observed_at":"2026-08-15T18:28:00.176739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.457832Z","title":"Transportability of causal and statistical relations: A formal approach","venue":null,"work_id":"2e46244b-eee1-41a4-87b8-89d6d7638efd","year":2011},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.181079Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:2a1bcebc379bc70f6b4c2341ccbf4eb26684c29aa1405b7ce8b215ea694b6550","observation_id":"f91307da-13ca-459b-8f56-3a5fb29cdd97","resolution":{"observed_at":"2026-08-15T18:28:00.461341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.446519Z","title":"Teacher algorithms for curriculum learning of deep rl in continuously parameterized environments","venue":null,"work_id":"61de0eb6-277f-4ff8-9f5b-bd112480c207","year":2020},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.184548Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:26a6f6bc751ebcc3c4cd57bf82ca7e95482029c8d471ef305d3d634fb1ee2dd8","observation_id":"a2e43f46-dc1b-4963-976c-f1817a2ffc2a","resolution":{"observed_at":"2026-08-15T18:28:00.451037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.436050Z","title":"Teachmyagent: a benchmark for automatic curriculum learning in deep rl","venue":null,"work_id":"94d7390c-a021-41dd-9d8d-15947add2dc2","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.188240Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:88232fa5aaf6c819336e589d231484e7a2f047bc34df37c810e06c4ec3b987f4","observation_id":"5621d954-c285-424f-9d58-52237674935a","resolution":{"observed_at":"2026-08-15T18:28:00.439583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.425233Z","title":"Diffusion-based curriculum reinforcement learning","venue":null,"work_id":"11e3c400-b8de-4688-869e-2f9f81b8ac0d","year":2024},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.191586Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:d93f6660b8b57d8f15e88a11fb4733b5cd88a7c683a324fc8dcbd5a4a3c024fb","observation_id":"aefe2270-83ed-4ef4-b5d4-0f698e0b25cd","resolution":{"observed_at":"2026-08-15T18:28:00.429025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.414277Z","title":"Schrader","venue":null,"work_id":"ad6223e4-93f8-4b9c-a89e-3648ea79ed9e","year":2018},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.195653Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:12303ec92fe5550cfb3ea07bb432cc58f308db31e1c42ab6a0d69ac609a02904","observation_id":"82d563a4-b226-4e48-81a9-8cd37a7e57ce","resolution":{"observed_at":"2026-08-15T18:28:00.418064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.402463Z","title":"Causal influence detection for improving efficiency in reinforcement learning","venue":null,"work_id":"002af7af-a484-4baa-87ae-d09e9168fa39","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.199843Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:efb3287e8066b981e6690bf03124e999211bffca5746bba7ecc6b844adcb34e6","observation_id":"566b5d69-16bd-4434-8efa-f5d05da3be1d","resolution":{"observed_at":"2026-08-15T18:28:00.406406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.390600Z","title":"Causal curiosity: Rl agents discovering self-supervised experiments for causal representation learning","venue":null,"work_id":"e194d7e7-0123-49d5-b652-3091f21064ae","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.203338Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:655ef02c283d20a4ba4fad6eb207f68e0e0f77d8d7e41fcedee484efebaa31e6","observation_id":"5f170e11-fc56-4447-94b1-2c725be7bc7f","resolution":{"observed_at":"2026-08-15T18:28:00.394659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.377935Z","title":"Model-based transfer reinforcement learning based on graphical model representations","venue":null,"work_id":"d99e3b76-82f8-4869-b528-b96a5ff250ee","year":2021},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.206840Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:d6a40d89a60cbf1c2d4ff31e9822c305e67df4554e9272b54317570bffcbaa1a","observation_id":"240d271b-ee25-4465-b5d2-27e86bda4fc1","resolution":{"observed_at":"2026-08-15T18:28:00.381847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.367062Z","title":"Proximal curriculum for reinforcement learning agents","venue":null,"work_id":"c69f978e-29b3-4abb-8f7d-36a4003d1080","year":2023},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.210282Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:2e546c2a8995fac7bec329fa2364112d8f899853c7d3a862e04f5988e65aea52","observation_id":"3fef1431-9f77-40bb-9775-8b97416c0a8a","resolution":{"observed_at":"2026-08-15T18:28:00.370682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03429","last_updated":"2023-02-07T12:30:52Z","snapshot_observed_at":"2026-08-16T15:57:07.019475Z","submitted_at":"2023-02-07T12:30:52Z","title":"Towards Skilled Population Curriculum for Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03429","snapshot_observed_at":"2026-08-15T18:28:00.213659Z","title":"Towards skilled population curriculum for multi-agent reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.213659Z"},"links":{"cited_paper":"/paper/2302.03429","citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:6b29fb75ce5aff6caafed6ec42e27f3b9883d5ccdbffe900bbaae88dc896c125","observation_id":"3e92b94a-44ff-4874-9438-5782ac516bb5","resolution":{"observed_at":"2026-08-15T18:28:00.213659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.356423Z","title":"Robust deep reinforcement learning through bootstrapped opportunistic curriculum","venue":null,"work_id":"542ab435-24ff-40ed-a352-4f32a1c59616","year":2022},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.217221Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:9b116891b14a7d0f74847a79be80ac99541fd92b1fee0cdebea12b1a21793ae1","observation_id":"e8afe934-d306-4498-8465-ccdbd63f5f48","resolution":{"observed_at":"2026-08-15T18:28:00.359967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.345387Z","title":"A survey on causal discovery: Theory and practice","venue":null,"work_id":"382431be-b272-4691-9c79-43f54dc8cd04","year":2022},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.220634Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:a222ed2d4fc919ef4afcae8de316893c8dc1ca30e7f066f08346527f7e788528","observation_id":"33ff1e63-a31e-4e78-90a3-7c46877566f0","resolution":{"observed_at":"2026-08-15T18:28:00.348977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.334343Z","title":"A survey on causal reinforcement learning","venue":null,"work_id":"07add196-7fca-4e17-934b-36a0a73fa914","year":2024},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.224080Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:9fc039399dab16dc6c0343294bb988ed87d13123ca9ab5c4903e12726272d46c","observation_id":"93815d39-fbf6-4df3-ad55-fe54ce644ed8","resolution":{"observed_at":"2026-08-15T18:28:00.338196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.227275Z","title":"Automatic curriculum learning through value disagreement","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.227275Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:137ee3587cea578ee78375fec3d4be6f786ae6f15e2e1993d3f7104ac95a39ff","observation_id":"c7c795ad-2cb9-49cc-a456-75937db7e144","resolution":{"observed_at":"2026-08-15T18:28:00.227275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.314802Z","title":"Invariant action effect model for reinforcement learning","venue":null,"work_id":"e723bb1e-6338-4d4c-96d4-5e3a286783b0","year":2022},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.230747Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:628065f9bc5e85481a8a44b01dce99e19fdfca0e421ce7c25550abf8b1cfcd20","observation_id":"0f6013d0-d781-4437-9eb5-db7ee1e88cc7","resolution":{"observed_at":"2026-08-15T18:28:00.320370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:28:00.234115Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T18:28:00.234115Z"},"links":{"citing_paper":"/paper/2507.02910"},"observation_digest":"sha256:fc824511d4f92aa35bd766054cdd90ea5c7d5c073940383f1374d2837f552b23","observation_id":"69cedf15-bae2-4474-8796-0ee57cd4de8b","resolution":{"observed_at":"2026-08-15T18:28:00.234115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02910","last_updated":"2025-06-24T20:15:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T19:47:00.886911Z","submitted_at":"2025-06-24T20:15:01Z","title":"Causal-Paced Deep Reinforcement Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.02910."}