{"as_of":"2026-08-08T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b34c25fd8b2d2361eb5af63a5790941d47f600042fe0d8c65540185624f3c4f1","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:48:52.758471Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:39:32.117730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"cited_work":{"arxiv_id":"2507.17668","doi":"10.48550/arxiv.2507.17668","metadata_source":"pith","pith_arxiv_id":"2507.17668","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","venue":"cs.LG","work_id":"52d300d1-6000-4f57-a703-1d4216cd9bc8","year":2025},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-07T18:56:05.725689Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.117730Z"},"links":{"cited_paper":"/paper/2507.17668","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:3cf176497e46ee246c4ffe19b844de0a2597b315d114c562d48043876d916f47","observation_id":"c32431f8-ff8d-4845-9333-b867b3e88878","resolution":{"observed_at":"2026-08-03T04:44:19.150566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17668/citation-record","integrity":"/paper/2507.17668/integrity","json":"/paper/2507.17668/citation-record.json","paper":"/paper/2507.17668"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.07507","last_updated":"2023-03-13T22:37:15Z","snapshot_observed_at":"2026-08-03T04:04:21.701677Z","submitted_at":"2023-03-13T22:37:15Z","title":"Loss of Plasticity in Continual Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07507","snapshot_observed_at":"2026-08-06T14:48:44.616239Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:44.616239Z"},"links":{"cited_paper":"/paper/2303.07507","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:5b0e383dc8b713656afd94c92b8c450eb3e9c566a09a6c95b56a869f52ca7807","observation_id":"a3d7ccb0-92bc-4646-b308-e5a76539886e","resolution":{"observed_at":"2026-08-06T14:48:44.616239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08894","last_updated":"2019-03-21T09:42:41Z","snapshot_observed_at":"2026-08-04T21:37:15.275989Z","submitted_at":"2019-03-21T09:42:41Z","title":"Towards Characterizing Divergence in Deep Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08894","snapshot_observed_at":"2026-08-06T14:48:44.681243Z","title":"Towards characterizing divergence in deep q-learning","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:44.681243Z"},"links":{"cited_paper":"/paper/1903.08894","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:b7c9f4f324d7f5249571ada6d721ad525b57a9abeff4964524d33b119a59bacd","observation_id":"24da469e-b54b-4146-bb26-ec474352ed58","resolution":{"observed_at":"2026-08-06T14:48:44.681243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07165","last_updated":"2025-02-04T05:17:26Z","snapshot_observed_at":"2026-07-06T20:04:25.198952Z","submitted_at":"2024-12-10T03:55:18Z","title":"A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07165","snapshot_observed_at":"2026-08-06T14:48:44.755232Z","title":"A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning , February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:44.755232Z"},"links":{"cited_paper":"/paper/2412.07165","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:aed0edadfbc7af2820155a7fbc47eb176168bc73d2f625d602fdb7eade032f85","observation_id":"f48faf5f-8f10-4095-b923-e3fe5bf3f8f4","resolution":{"observed_at":"2026-08-06T14:48:44.755232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:44.809562Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:44.809562Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:429e0633957f6b52a410779042b46673f4dcca5e520f6184885cee444222942e","observation_id":"b19f019a-93e9-4b0d-b221-c531836e6370","resolution":{"observed_at":"2026-08-06T14:48:44.809562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00958","last_updated":"2021-06-07T19:36:13Z","snapshot_observed_at":"2026-08-08T05:06:04.564653Z","submitted_at":"2021-06-02T06:03:18Z","title":"A Generalizable Approach to Learning Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00958","snapshot_observed_at":"2026-08-06T14:48:44.948249Z","title":"A Generalizable Approach to Learning Optimizers , June 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:44.948249Z"},"links":{"cited_paper":"/paper/2106.00958","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:00e5984cf9e73b2864e73091616383bc0c7de85dbc20d8f3aae7e0dee6174bec","observation_id":"44b1374f-aa2b-4bff-a13f-84907f107a90","resolution":{"observed_at":"2026-08-06T14:48:44.948249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:45.089106Z","title":"Hoffman, David Pfau, Tom Schaul, Brendan Shillingford, and Nando de Freitas","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.089106Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:b07518c250f709449b9a9149db1e1ed9f1545cff395d75881bb5a4c968a94c99","observation_id":"34b95b01-ac5e-4eaf-afc5-9dd2e849b3f3","resolution":{"observed_at":"2026-08-06T14:48:45.089106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:45.201906Z","title":"An information-theoretic perspective on intrinsic motivation in reinforcement learning: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.201906Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:169ea79de450cd4ec0febf8e06304d6112a6a6251316421d45cc8e021fe6641a","observation_id":"2fafa30b-8079-487a-bd81-65d3d1db55d3","resolution":{"observed_at":"2026-08-06T14:48:45.201906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-06T07:16:48.853653Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-06T14:48:45.339004Z","title":"A Survey of Meta - Reinforcement Learning , August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.339004Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:29d1453981b4806ee06fef5851a1b549c769d89e59483106f5a64f233ccc1983","observation_id":"59369bea-951d-4879-922e-ac071fdf0ea3","resolution":{"observed_at":"2026-08-06T14:48:45.339004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:45.485426Z","title":"OpenAI gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.485426Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:796852b917093f1cca8f906e28d6e4e9c4e7a10add4c2eaa6ef69af258a88000","observation_id":"8fd95d5d-5e2d-46b6-84db-12a0aa2f778f","resolution":{"observed_at":"2026-08-06T14:48:45.485426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T14:48:45.624540Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.624540Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:eba4d7c0694faf57fa6cbb5e1d9f65d3a2de570eeefef54a580fd4e7b81f6130","observation_id":"379f9e2e-23a4-4b86-8f11-d59bb3c045d6","resolution":{"observed_at":"2026-08-06T14:48:45.624540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:45.793806Z","title":"Boltzmann exploration done right","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.793806Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:94bf6fc81ee5beb5241e6d7aa31102a1c888af96464b0c83930b5191ca41f6bd","observation_id":"5dc19526-a0f3-4c51-bbe0-c15aaf14490d","resolution":{"observed_at":"2026-08-06T14:48:45.793806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06675","last_updated":"2023-05-08T21:49:57Z","snapshot_observed_at":"2026-08-02T01:29:22.350700Z","submitted_at":"2023-02-13T20:27:30Z","title":"Symbolic Discovery of Optimization Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06675","snapshot_observed_at":"2026-08-06T14:48:45.939586Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:45.939586Z"},"links":{"cited_paper":"/paper/2302.06675","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:94e567ebb427ebc0ee5acb65656262135e84a62fe762a40069f3f7fae52c4d21","observation_id":"2049f298-757a-4752-a563-7d78d809c499","resolution":{"observed_at":"2026-08-06T14:48:45.939586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01582","last_updated":"2023-05-05T17:44:07Z","snapshot_observed_at":"2026-07-06T15:22:25.008777Z","submitted_at":"2023-05-02T16:31:35Z","title":"Interpretable Machine Learning for Science with PySR and SymbolicRegression.jl","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01582","snapshot_observed_at":"2026-08-06T14:48:46.030210Z","title":"Interpretable Machine Learning for Science with PySR and SymbolicRegression .jl, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.030210Z"},"links":{"cited_paper":"/paper/2305.01582","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:a45790db11890b9f6539e5e923341f8d2f089f349e7b3550932bfee9206e14e0","observation_id":"1e634b23-c977-4fb1-adee-0abef0b42e18","resolution":{"observed_at":"2026-08-06T14:48:46.030210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11287","last_updated":"2020-11-18T01:16:09Z","snapshot_observed_at":"2026-07-06T09:30:50.462029Z","submitted_at":"2020-06-19T18:00:00Z","title":"Discovering Symbolic Models from Deep Learning with Inductive Biases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11287","snapshot_observed_at":"2026-08-06T14:48:46.105628Z","title":"Discovering Symbolic Models from Deep Learning with Inductive Biases , November 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.105628Z"},"links":{"cited_paper":"/paper/2006.11287","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:dfc4d1ac152900e9f8bb931ce63b6ffe899268f4e2454f8da88a027bd4d38d83","observation_id":"1aea3f56-9912-422e-8722-f2befb70c15f","resolution":{"observed_at":"2026-08-06T14:48:46.105628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T14:48:46.158711Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.158711Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:3a1e69aebe0f188da66556789fb7dbd5713fa8cd82e47b7e6714a099faf6c722","observation_id":"707eb909-41c4-4c9a-bf29-55fb711e05c8","resolution":{"observed_at":"2026-08-06T14:48:46.158711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02096","last_updated":"2021-02-04T03:01:31Z","snapshot_observed_at":"2026-07-06T10:20:26.819889Z","submitted_at":"2020-12-03T17:37:01Z","title":"Emergent Complexity and Zero-shot Transfer via Unsupervised Environment Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.02096","snapshot_observed_at":"2026-08-06T14:48:46.239937Z","title":"Emergent Complexity and Zero -shot Transfer via Unsupervised Environment Design , February 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.239937Z"},"links":{"cited_paper":"/paper/2012.02096","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:78d886790ee21b7f9fb36b7c68c127fdcd5f48ff8f1e5bff7aa7792962a63dad","observation_id":"96506966-4351-4c0c-80b6-4511d5ffe9e5","resolution":{"observed_at":"2026-08-06T14:48:46.239937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:46.309720Z","title":"Loss of plasticity in deep continual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.309720Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:98e532c78719e4b00e4ca803385a0d9627bfc8bcc1e70cf8f8d617d44104140d","observation_id":"82b12f95-c64e-4c2d-849b-84e96f4da4d9","resolution":{"observed_at":"2026-08-06T14:48:46.309720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-06T14:48:46.395863Z","title":"Rl ^2 : Fast reinforcement learning via slow reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.395863Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:b41e7e5c29707208810326ad78ee29b482055d344694f7a60cfa94ae12289f7b","observation_id":"bad298e5-b312-469a-9370-21d35555a317","resolution":{"observed_at":"2026-08-06T14:48:46.395863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17113","last_updated":"2024-12-22T18:01:08Z","snapshot_observed_at":"2026-08-04T04:39:14.357607Z","submitted_at":"2024-12-22T18:01:08Z","title":"Adam on Local Time: Addressing Nonstationarity in RL with Relative Adam Timesteps","version":1},"cited_work":{"arxiv_id":"2412.17113","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17113","snapshot_observed_at":"2026-08-06T14:48:54.045266Z","title":"Adam on Local Time: Addressing Nonstationarity in RL with Relative Adam Timesteps","venue":"cs.LG","work_id":"0b5dbee5-4ada-4385-973f-0dc19097eeeb","year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.513473Z"},"links":{"cited_paper":"/paper/2412.17113","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:3c2ccda430369a08fdf8e716e815fc5905c0283e23b2b6cbfc1d0c53ed08d987","observation_id":"f70732c3-e78c-447d-b9f7-793c88ad0058","resolution":{"observed_at":"2026-08-06T14:48:54.113207Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15568","last_updated":"2025-02-14T14:24:59Z","snapshot_observed_at":"2026-07-06T18:19:21.735356Z","submitted_at":"2024-05-24T13:57:32Z","title":"OMNI-EPIC: Open-endedness via Models of human Notions of Interestingness with Environments Programmed in Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15568","snapshot_observed_at":"2026-08-06T14:48:46.585185Z","title":"OMNI - EPIC : Open -endedness via Models of human Notions of Interestingness with Environments Programmed in Code , May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.585185Z"},"links":{"cited_paper":"/paper/2405.15568","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:6d5f921bc510f30f5db687b09d6902b9aa21b43c54a0cfafa1527ed13a235af1","observation_id":"e97cd32c-805c-4709-bced-cce321896e67","resolution":{"observed_at":"2026-08-06T14:48:46.585185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:46.675019Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.675019Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:ff8b1413c43856a2d25c63b84d5dfbaac18a27b4c9c960d8190d6957e11d310e","observation_id":"6454b23b-eafe-4b95-bb70-59f7f5a77502","resolution":{"observed_at":"2026-08-06T14:48:46.675019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.10295","last_updated":"2019-07-09T09:57:23Z","snapshot_observed_at":"2026-07-06T05:49:17.299252Z","submitted_at":"2017-06-30T17:56:19Z","title":"Noisy Networks for Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.10295","snapshot_observed_at":"2026-08-06T14:48:46.738150Z","title":"Noisy Networks for Exploration , July 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.738150Z"},"links":{"cited_paper":"/paper/1706.10295","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:65688fef4dc73ba998a8c03c88ff16452d8a0674bc23cd75182265587836860c","observation_id":"23895565-0168-4277-9fd2-a917f64ddf2e","resolution":{"observed_at":"2026-08-06T14:48:46.738150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:46.822940Z","title":"Daniel Freeman, Erik Frey, Anton Raichuk, Sertan Girgin, Igor Mordatch, and Olivier Bachem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.822940Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:46ee3c32678080314a7457aa375249d3a37f48f043ef86e77194e16a678d8cbf","observation_id":"faaafd20-4489-409b-b34e-4e5bd93cbcb1","resolution":{"observed_at":"2026-08-06T14:48:46.822940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04770","last_updated":"2018-06-29T10:46:28Z","snapshot_observed_at":"2026-08-08T03:04:41.455076Z","submitted_at":"2018-05-12T19:48:50Z","title":"Born Again Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04770","snapshot_observed_at":"2026-08-06T14:48:46.904574Z","title":"Lipton, Michael Tschannen, Laurent Itti, and Anima Anandkumar","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:46.904574Z"},"links":{"cited_paper":"/paper/1805.04770","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:d70991e161e1f680e494071b7aab9b71e69d008a69a844f68508021867a1e6e3","observation_id":"0648e23b-f653-4be6-b3c1-e4613c3559fc","resolution":{"observed_at":"2026-08-06T14:48:46.904574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:59.009794Z","title":"Goldie, Chris Lu, Matthew T","venue":null,"work_id":"e544e906-f647-439f-b507-caabaef8b0f3","year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.000738Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:d80c9ad8d8a5e1ad9f1448bc6e3f22dd37a3e0379abe8e38565b73cadda73598","observation_id":"c4e7164c-4f0c-4ab6-a9c1-9520d6a6f49a","resolution":{"observed_at":"2026-08-06T14:48:59.178524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06780","last_updated":"2022-02-12T20:02:13Z","snapshot_observed_at":"2026-08-08T06:33:33.529614Z","submitted_at":"2021-09-14T15:49:31Z","title":"Benchmarking the Spectrum of Agent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06780","snapshot_observed_at":"2026-08-06T14:48:47.078571Z","title":"Benchmarking the spectrum of agent capabilities","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.078571Z"},"links":{"cited_paper":"/paper/2109.06780","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:03ddc9014fc361fbbd160d7d97f2f66935ff95f7e1ba5b5aa03c014a739e203e","observation_id":"0d14a9d1-f1ad-4f76-9b59-997042574c7c","resolution":{"observed_at":"2026-08-06T14:48:47.078571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T14:48:47.149052Z","title":"Distilling the Knowledge in a Neural Network , March 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.149052Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:66688ef86fd6abf533e5c7ca61eb1e10424c8e9c465e322d85ac863b7407ea0e","observation_id":"3d14ae1c-d8f4-47b8-a380-a881f6b7f07d","resolution":{"observed_at":"2026-08-06T14:48:47.149052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:47.222901Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.222901Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:790a279eabdd3041c2634400d7028fdc36db514dc152baab16fe1cda942bc1ce","observation_id":"4080903f-56ca-481e-9526-3d647585a01f","resolution":{"observed_at":"2026-08-06T14:48:47.222901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08435","last_updated":"2025-03-02T05:13:28Z","snapshot_observed_at":"2026-08-06T11:45:45.286982Z","submitted_at":"2024-08-15T21:59:23Z","title":"Automated Design of Agentic Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08435","snapshot_observed_at":"2026-08-06T14:48:47.306436Z","title":"Automated Design of Agentic Systems , August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.306436Z"},"links":{"cited_paper":"/paper/2408.08435","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:13404068a42ab4bbe43465804edeec2c14052335ce2baa6d44e4b5ecd813e028","observation_id":"dc9c16ba-60c7-4c79-90e9-7a662088ee40","resolution":{"observed_at":"2026-08-06T14:48:47.306436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:58.712176Z","title":"Transient non-stationarity and generalisation in deep reinforcement learning","venue":null,"work_id":"114c0105-cb25-4dd2-80d9-9e6394ab80b0","year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.383576Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:b2ea50c837218ad0e270754e3dd02cdc15c8819868c40d7f97fbe86f37d764d9","observation_id":"41b311f6-d302-40b8-a5ea-f13008d342b1","resolution":{"observed_at":"2026-08-06T14:48:58.888824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:58.501517Z","title":"Transient non-stationarity and generalisation in deep reinforcement learning","venue":null,"work_id":"06fa27e4-e03d-4e15-90e8-a6ebd2a5bb8f","year":2021},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.471532Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:6f4e41c0eb44a47661499b7ef97e65e03e7f83a70a05513460b93ddd01e77df1","observation_id":"0edfac8e-8273-47a5-aa23-a12663df7d34","resolution":{"observed_at":"2026-08-06T14:48:58.610653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02782","last_updated":"2023-10-04T12:52:56Z","snapshot_observed_at":"2026-08-05T12:47:52.980269Z","submitted_at":"2023-10-04T12:52:56Z","title":"Discovering General Reinforcement Learning Algorithms with Adversarial Environment Design","version":1},"cited_work":{"arxiv_id":"2310.02782","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02782","snapshot_observed_at":"2026-08-06T14:48:53.776031Z","title":"Discovering General Reinforcement Learning Algorithms with Adversarial Environment Design","venue":"cs.LG","work_id":"41f766b7-83ef-4140-981a-922420a7395b","year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.539950Z"},"links":{"cited_paper":"/paper/2310.02782","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:a3c727151899e51aa86e4cc83844ade3d9163b776a701f9810fb893563ace62f","observation_id":"7d42ccf3-7005-4fd5-8841-a55667aa143c","resolution":{"observed_at":"2026-08-06T14:48:53.861384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:58.249012Z","title":"Discovering temporally-aware reinforcement learning algorithms","venue":null,"work_id":"7b00c119-be0f-41e5-b7af-a0387f9b3222","year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.617075Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:c45ac70555a385eaac1f28bbae0187249c0f40e3e123b6740059168e7773fd04","observation_id":"820da51f-8024-4178-abbc-91a7e9405067","resolution":{"observed_at":"2026-08-06T14:48:58.350351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:57.960174Z","title":"Improving policy optimization with generalist-specialist learning","venue":null,"work_id":"104936dc-8974-4477-a4a1-6e2fe4e86830","year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.682731Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:5ed08f7890824e96172518635ac772c7da699c8b2836f5d156c731616a526163","observation_id":"6bf5b200-36ad-4e13-9410-c95c9baf1e10","resolution":{"observed_at":"2026-08-06T14:48:58.129243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14905","last_updated":"2022-03-13T11:41:05Z","snapshot_observed_at":"2026-08-07T18:05:48.603362Z","submitted_at":"2020-12-29T18:56:10Z","title":"Meta Learning Backpropagation And Improving It","version":4},"cited_work":{"arxiv_id":"2012.14905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.14905","snapshot_observed_at":"2026-08-06T14:48:53.625232Z","title":"Meta Learning Backpropagation And Improving It","venue":"cs.LG","work_id":"abd5b5b7-c120-4299-9137-7fc8a4adf0cd","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.763840Z"},"links":{"cited_paper":"/paper/2012.14905","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:30a278e3407ba62f83100b68038787173f329be9323107f29cbad80475df557f","observation_id":"3a1a5cb6-507c-49c1-adf6-d89d5bf2585e","resolution":{"observed_at":"2026-08-06T14:48:53.690763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:57.723585Z","title":"Improving generalization in meta reinforcement learning using learned objectives","venue":null,"work_id":"13885b9f-b88f-4421-9563-e600879e477d","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.817050Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:9ddc61a8d2800d50ece9402829797066e97c15fa9d0a9c784840fd697b813044","observation_id":"267ff5a4-13c3-4ac9-98bb-2b92691851ef","resolution":{"observed_at":"2026-08-06T14:48:57.828958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02373","last_updated":"2024-11-19T22:08:01Z","snapshot_observed_at":"2026-07-06T12:25:23.259452Z","submitted_at":"2022-01-07T09:16:03Z","title":"Mirror Learning: A Unifying Framework of Policy Optimisation","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02373","snapshot_observed_at":"2026-08-06T14:48:47.878994Z","title":"Mirror Learning : A Unifying Framework of Policy Optimisation , November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.878994Z"},"links":{"cited_paper":"/paper/2201.02373","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:1626841a4f5c2a4dc98f88162da30b769e5f3a04467ac0aeee5bc0660bc5c271","observation_id":"2517e4d0-afda-4d88-927b-a6d3a685f536","resolution":{"observed_at":"2026-08-06T14:48:47.878994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01470","last_updated":"2024-06-04T07:52:31Z","snapshot_observed_at":"2026-07-06T14:47:56.365341Z","submitted_at":"2023-02-03T00:11:02Z","title":"Learning to Optimize for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01470","snapshot_observed_at":"2026-08-06T14:48:47.922233Z","title":"Rupam Mahmood, Shuicheng Yan, and Zhongwen Xu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.922233Z"},"links":{"cited_paper":"/paper/2302.01470","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:ba632c7eb340fbdce3ad8da9abb30de4f0bfd8c93df26c703dc66ac5d420ae5b","observation_id":"853ffeb4-20c3-4278-8903-a0cc889d3f0f","resolution":{"observed_at":"2026-08-06T14:48:47.922233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:57.568172Z","title":"gymnax: A JAX -based reinforcement learning environment library, 2022 a","venue":null,"work_id":"376ccc49-6f14-4dd7-902f-9615fe90e758","year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:47.972077Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:8f8a43dbab847d065758878972cc11fe83865b2a7c1c637a4707e935d1e43016","observation_id":"670b210f-af41-461e-9f14-69132d7b1c52","resolution":{"observed_at":"2026-08-06T14:48:57.659181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04180","last_updated":"2022-12-08T10:34:42Z","snapshot_observed_at":"2026-08-07T15:19:01.325646Z","submitted_at":"2022-12-08T10:34:42Z","title":"evosax: JAX-based Evolution Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04180","snapshot_observed_at":"2026-08-06T14:48:48.110073Z","title":"evosax: JAX -based Evolution Strategies","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.110073Z"},"links":{"cited_paper":"/paper/2212.04180","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:4a75cb513467510e3c93f62d349dabab3b8a544a82870882d60716e2ee82ad02","observation_id":"1c5b6137-edd7-4d39-98f1-7d410a52472f","resolution":{"observed_at":"2026-08-06T14:48:48.110073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:57.391781Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":"c3e953c7-fcc1-41e9-b8c6-10bcf938a6a9","year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.255410Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:15904b2d334a42eef2ae8bea38269150ab4cd1eeb7595c9d0fb24265c401aaa1","observation_id":"2a2eb53a-4375-4fbb-9164-1db3ebb27504","resolution":{"observed_at":"2026-08-06T14:48:57.496541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08896","last_updated":"2022-06-17T17:07:04Z","snapshot_observed_at":"2026-07-06T13:22:05.813672Z","submitted_at":"2022-06-17T17:07:04Z","title":"Evolution through Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08896","snapshot_observed_at":"2026-08-06T14:48:48.383996Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.383996Z"},"links":{"cited_paper":"/paper/2206.08896","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:8d254886ef0d5fba23d16c09637cc6e5622d50eabb8f9fb54d0a0b5d54d51048","observation_id":"a65675a6-b2a8-42da-91e0-7c76d1806eac","resolution":{"observed_at":"2026-08-06T14:48:48.383996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:57.261789Z","title":"Rediscovering orbital mechanics with machine learning","venue":null,"work_id":"40fd3ff3-f359-48e9-93e6-52cac3654c8e","year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.486735Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:670f70423b31f3120ed475e352e34e6d93c5deea6adf9da1fd50b423bb7d6395","observation_id":"ea817af4-650b-4692-a29a-e8901cb12399","resolution":{"observed_at":"2026-08-06T14:48:57.338948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:57.086899Z","title":"Discovered policy optimisation","venue":null,"work_id":"41685b91-249c-4c05-a992-dadf80f35c46","year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.575011Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:61a9f086ab5e2321ded5699e2d10cf6d68a8dc4b7d00ca30375a3e639656b877","observation_id":"35ca94b3-032a-4957-86d1-36418967adeb","resolution":{"observed_at":"2026-08-06T14:48:57.186310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08414","last_updated":"2024-11-02T22:34:31Z","snapshot_observed_at":"2026-08-04T19:50:50.219376Z","submitted_at":"2024-06-12T16:58:41Z","title":"Discovering Preference Optimization Algorithms with and for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08414","snapshot_observed_at":"2026-08-06T14:48:48.754244Z","title":"Chan, Jakob Foerster, Mihaela van der Schaar, and Robert Tjarko Lange","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.754244Z"},"links":{"cited_paper":"/paper/2406.08414","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:7860f549b52fe0396ff7baa869ddbc74b0d5398e7bff1db71bfefd0423158f72","observation_id":"4d9a5bb5-e31a-4381-89b2-6e54d990ab38","resolution":{"observed_at":"2026-08-06T14:48:48.754244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:56.940437Z","title":"Behaviour Distillation","venue":null,"work_id":"46129075-626c-4e97-bbc7-7daa3cc02ceb","year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:48.891797Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:b9dadfa00863e2f36897aa23e4b60b9d8c368cdb3cf7070c367fe53bdc21359c","observation_id":"af015423-f7fa-41e0-9775-a370f6364081","resolution":{"observed_at":"2026-08-06T14:48:57.015958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01486","last_updated":"2023-11-27T16:36:53Z","snapshot_observed_at":"2026-08-07T17:21:35.546621Z","submitted_at":"2023-03-02T18:47:51Z","title":"Understanding plasticity in neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01486","snapshot_observed_at":"2026-08-06T14:48:49.023177Z","title":"Understanding plasticity in neural networks, August 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.023177Z"},"links":{"cited_paper":"/paper/2303.01486","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:36183932175e886a43d3501dbfe2a813b270a17be54d3765b07598733ccd6708","observation_id":"0c5f61b8-a66c-4923-a626-748f3e6bdea9","resolution":{"observed_at":"2026-08-06T14:48:49.023177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:56.735718Z","title":"Craftax: a lightning-fast benchmark for open-ended reinforcement learning","venue":null,"work_id":"9a64174d-bec2-4e21-ae3f-104f7962f080","year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.134832Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:015ac0a818b1fc171639b168f7b3c6833ad915c245d6b1ba308c03378ba9687a","observation_id":"0336ceb2-4e37-44af-9cc1-59d24cf54dfd","resolution":{"observed_at":"2026-08-06T14:48:56.824630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:56.551896Z","title":"Interpretable machine learning methods applied to jet background subtraction in heavy-ion collisions","venue":null,"work_id":"51896e82-9cf4-47fa-9192-d0b287a16fce","year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.301257Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:f7dfa2d9aa2ea16c21c7a16d153bf8b64b8b5e10fa7df826f3ca9ea24193e4e7","observation_id":"759aebf1-ca1f-4df1-8d37-a0074a1264b0","resolution":{"observed_at":"2026-08-06T14:48:56.652401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00222","last_updated":"2019-02-26T05:26:00Z","snapshot_observed_at":"2026-08-06T06:47:42.462480Z","submitted_at":"2018-03-31T22:44:28Z","title":"Meta-Learning Update Rules for Unsupervised Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00222","snapshot_observed_at":"2026-08-06T14:48:49.432448Z","title":"Meta- Learning Update Rules for Unsupervised Representation Learning , February 2019 a","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.432448Z"},"links":{"cited_paper":"/paper/1804.00222","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:751e708cf605c3881826faa008342921ca0272dcce80c665654703fcfa3f2f7b","observation_id":"6ce3b857-d15e-46fb-98c2-40ec67b58731","resolution":{"observed_at":"2026-08-06T14:48:49.432448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.10180","last_updated":"2019-06-08T00:33:09Z","snapshot_observed_at":"2026-07-06T07:10:12.570041Z","submitted_at":"2018-10-24T04:04:25Z","title":"Understanding and correcting pathologies in the training of learned optimizers","version":5},"cited_work":{"arxiv_id":"1810.10180","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.10180","snapshot_observed_at":"2026-08-06T14:48:53.422504Z","title":"Understanding and correcting pathologies in the training of learned optimizers","venue":"cs.NE","work_id":"649189b1-d242-43fe-934d-0bd08afd8cb7","year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.527570Z"},"links":{"cited_paper":"/paper/1810.10180","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:81421b4ea78eb6adee8518df79a53d9fce1dd34698085aa8bbddb11b1fe2fc25","observation_id":"0df60976-ee7b-48c8-8d27-81fe624486ab","resolution":{"observed_at":"2026-08-06T14:48:53.486491Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11243","last_updated":"2020-09-23T16:35:09Z","snapshot_observed_at":"2026-08-06T12:12:15.481512Z","submitted_at":"2020-09-23T16:35:09Z","title":"Tasks, stability, architecture, and compute: Training more effective learned optimizers, and using them to train themselves","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11243","snapshot_observed_at":"2026-08-06T14:48:49.605196Z","title":"Daniel Freeman, Ben Poole, and Jascha Sohl-Dickstein","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.605196Z"},"links":{"cited_paper":"/paper/2009.11243","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:c974bb90c47a718e282eb3cc4294b4600be5a3b6099606a75cb9a1cc4cb21813","observation_id":"44f62159-29b7-427f-9199-f6b3536a3d0c","resolution":{"observed_at":"2026-08-06T14:48:49.605196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05803","last_updated":"2022-01-21T02:07:54Z","snapshot_observed_at":"2026-08-08T19:00:30.082098Z","submitted_at":"2021-11-10T16:51:04Z","title":"Gradients are Not All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05803","snapshot_observed_at":"2026-08-06T14:48:49.755270Z","title":"Daniel Freeman, Samuel S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.755270Z"},"links":{"cited_paper":"/paper/2111.05803","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:19326faf1dfa78b3671aecd3d2c63d0b8c422743174fdb3a2e02d7324aa0be0c","observation_id":"0610a14e-4f3a-47f2-9159-606f1641d390","resolution":{"observed_at":"2026-08-06T14:48:49.755270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09760","last_updated":"2022-11-17T18:39:07Z","snapshot_observed_at":"2026-08-07T23:26:47.442586Z","submitted_at":"2022-11-17T18:39:07Z","title":"VeLO: Training Versatile Learned Optimizers by Scaling Up","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09760","snapshot_observed_at":"2026-08-06T14:48:49.872182Z","title":"Daniel Freeman, Amil Merchant, Lucas Beyer, James Bradbury, Naman Agrawal, Ben Poole, Igor Mordatch, Adam Roberts, and Jascha Sohl-Dickstein","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:49.872182Z"},"links":{"cited_paper":"/paper/2211.09760","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:0810414f1ebe390e59dbb64386e9176632abe73145a49d7416e00c686450bb14","observation_id":"76f8e25e-1c33-4720-a7f4-075bb6db140e","resolution":{"observed_at":"2026-08-06T14:48:49.872182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:56.378307Z","title":"Self-distillation amplifies regularization in hilbert space","venue":null,"work_id":"81b4eebd-878b-40a4-a5b8-22b6150c79e8","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.019447Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:473f80389a0631fe2289e54b119692e0109b3e4140c218daa8383532509969cb","observation_id":"a99fa079-00a9-49d9-b6e0-52fbad2f45cb","resolution":{"observed_at":"2026-08-06T14:48:56.459946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:56.204300Z","title":"Small batch deep reinforcement learning","venue":null,"work_id":"06ba390a-7d91-4aec-9e21-d11f60a6f782","year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.139633Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:de18db20c314de26ab2ef061174512d23d7f0e2e5b42e0f2d860d1659624c219","observation_id":"72858513-525e-4cb8-8404-30205921394e","resolution":{"observed_at":"2026-08-06T14:48:56.295508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:56.050593Z","title":"Discovering reinforcement learning algorithms","venue":null,"work_id":"4f6c1405-6d53-4290-9de8-8ae4148682b0","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.254660Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:30e58c53f43e959910fb22914950c2456a5fdd8bafb2c85d3fd7e623a27aceff","observation_id":"afcfcb2f-aebb-41cd-89c1-e2a2d7896257","resolution":{"observed_at":"2026-08-06T14:48:56.134460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:55.896254Z","title":"Openai o3-mini, January 2025","venue":null,"work_id":"bb178c13-174e-4a84-a430-1cd24c96ec2d","year":2025},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.382465Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:528bf5960fed5e00c94ccb0e1e8cbe72e86ffde2f960f2e55d47309da977279c","observation_id":"8075000c-14fd-47d8-9aed-dfdac0ce7168","resolution":{"observed_at":"2026-08-06T14:48:55.965617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:55.687916Z","title":"Stabilizing transformers for reinforcement learning","venue":null,"work_id":"214178e0-190e-4936-8be3-4392d51ff8a3","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.452623Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:20cc6ce5ce317a6f332f145977c4eaa379eb1b8924b4fc03435a83d84b5eaa4d","observation_id":"836da2ff-865c-4390-b4c4-0b61b1be5c16","resolution":{"observed_at":"2026-08-06T14:48:55.789331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:55.507928Z","title":"Evolving Curricula with Regret - Based Environment Design","venue":null,"work_id":"478718a1-abcb-45be-ba8f-0ec294b8b275","year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.495021Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:d34de6f2771729c94c41bbb0337ef30ef2efab4f7278ad926e6b4822575cbf35","observation_id":"b3da679a-906b-4c9d-810a-8580885f52c3","resolution":{"observed_at":"2026-08-06T14:48:55.589660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01905","last_updated":"2018-01-31T09:05:10Z","snapshot_observed_at":"2026-08-06T12:54:16.561808Z","submitted_at":"2017-06-06T18:09:29Z","title":"Parameter Space Noise for Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01905","snapshot_observed_at":"2026-08-06T14:48:50.593230Z","title":"Chen, Xi Chen, Tamim Asfour, Pieter Abbeel, and Marcin Andrychowicz","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.593230Z"},"links":{"cited_paper":"/paper/1706.01905","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:23b4b175b727691400009bbbb1351143eb2cd3f1f4eab1a1b3c0ca2af783951d","observation_id":"8f69eaaf-88c3-44ef-a1dd-9c73bda00a80","resolution":{"observed_at":"2026-08-06T14:48:50.593230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:55.261486Z","title":"Tunability: Importance of hyperparameters of machine learning algorithms","venue":null,"work_id":"b06a6b12-d7f3-44aa-abb5-caaeed6812f4","year":2019},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.706376Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:7927bec18c0f236fe86e1f63da3a6215b17e453b1e5b2b27956fadcd0ed8ea3d","observation_id":"d359abff-4acd-473c-8099-de350efa7649","resolution":{"observed_at":"2026-08-06T14:48:55.346301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:55.108581Z","title":"Evolutionsstrategie : Optimierung technischer systeme nach prinzipien der biologischen evolution","venue":null,"work_id":"fdbbd926-9486-422e-a37f-d3bf0cd69ecb","year":1973},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.800901Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:229fb0fa864e670aeac28e6a5ad73c5dccbf49ab2097d9e95dc189bff924bfb5","observation_id":"a2e2d967-75c0-47e9-8a37-fb87210c6462","resolution":{"observed_at":"2026-08-06T14:48:55.153556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:50.860051Z","title":"Pawan Kumar, Emilien Dupont, Francisco J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.860051Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:d98aadd85cacb1f4d3e787fed6f223109533141d797d2d16d986f258557ca58a","observation_id":"9bb36e11-6709-4c14-9b4c-ea544ef8c666","resolution":{"observed_at":"2026-08-06T14:48:50.860051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-06T14:48:50.969246Z","title":"Rusu, Sergio Gomez Colmenarejo, Caglar Gulcehre, Guillaume Desjardins, James Kirkpatrick, Razvan Pascanu, Volodymyr Mnih, Koray Kavukcuoglu, and Raia Hadsell","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:50.969246Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:4705561ddabe23032e41eb68c5b5ba9f7bdc64a0d138c0ccedd7e63b80bf2ad5","observation_id":"f77d5312-72e7-4aeb-93d5-b885a82980a1","resolution":{"observed_at":"2026-08-06T14:48:50.969246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-06T14:48:51.080292Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning , September 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.080292Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:324c3822d38d336bd1589069761090c6ec0ae8bf5367ae1396a73380bc9e8bfa","observation_id":"1dfd04f3-40b7-4c24-ac86-7f19ddad9f85","resolution":{"observed_at":"2026-08-06T14:48:51.080292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T14:48:51.130615Z","title":"Proximal Policy Optimization Algorithms , August 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.130615Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:cf1ab557233324a06e82081d62ca817647cbf333ff064740238724d71469ae5f","observation_id":"21e3588a-9d4c-44ad-b16e-341ea7d14213","resolution":{"observed_at":"2026-08-06T14:48:51.130615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T14:48:51.229277Z","title":"High- Dimensional Continuous Control Using Generalized Advantage Estimation , October 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.229277Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:c80755b0b72ce5ae34b5deb226d592fcc2812098ab53d6290306c0c65981efe0","observation_id":"30db874b-70dd-4448-bbc1-1cb7d6c5b9ef","resolution":{"observed_at":"2026-08-06T14:48:51.229277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12902","last_updated":"2023-06-13T15:16:55Z","snapshot_observed_at":"2026-07-06T14:55:37.939806Z","submitted_at":"2023-02-24T21:20:18Z","title":"The Dormant Neuron Phenomenon in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12902","snapshot_observed_at":"2026-08-06T14:48:51.326750Z","title":"The Dormant Neuron Phenomenon in Deep Reinforcement Learning , June 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.326750Z"},"links":{"cited_paper":"/paper/2302.12902","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:46071ca52ac06b270baf5aa33b9668ad00bd80c23a3051e7351c46003808452a","observation_id":"945e19ab-25ed-45ef-90d3-58f813481d85","resolution":{"observed_at":"2026-08-06T14:48:51.326750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19009","last_updated":"2025-02-26T10:16:57Z","snapshot_observed_at":"2026-08-07T17:47:21.935456Z","submitted_at":"2025-02-26T10:16:57Z","title":"Distilling Reinforcement Learning Algorithms for In-Context Model-Based Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19009","snapshot_observed_at":"2026-08-06T14:48:51.431138Z","title":"Distilling Reinforcement Learning Algorithms for In - Context Model - Based Planning , February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.431138Z"},"links":{"cited_paper":"/paper/2502.19009","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:0ef04144516564097b082a027275135e28da7bd722a9b01c718e51853df6bc11","observation_id":"d765ea3d-991b-4127-946d-725e108653ad","resolution":{"observed_at":"2026-08-06T14:48:51.431138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:54.937746Z","title":"Generalizable Symbolic Optimizer Learning","venue":null,"work_id":"9319f874-d338-4e14-8bf2-3a6c9fe356c6","year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.499138Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:d76daf88824fc528de7e0271bede8418a6be39a2064bd567b07286049b764208","observation_id":"3f177879-b4e0-4a29-adab-9a732bd859f2","resolution":{"observed_at":"2026-08-06T14:48:55.021535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03547","last_updated":"2024-05-09T14:44:22Z","snapshot_observed_at":"2026-07-06T18:10:29.627336Z","submitted_at":"2024-05-06T15:10:46Z","title":"Position: Leverage Foundational Models for Black-Box Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03547","snapshot_observed_at":"2026-08-06T14:48:51.550816Z","title":"Position: Leverage Foundational Models for Black - Box Optimization , May 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.550816Z"},"links":{"cited_paper":"/paper/2405.03547","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:67024d01e75ce5685f4bc7a35c91420bd6e014e784cc671dad591b2677e183f3","observation_id":"cf324fbd-f556-48f8-ba71-a16468de3b0e","resolution":{"observed_at":"2026-08-06T14:48:51.550816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:54.756314Z","title":"Maxinfo RL : Boosting exploration in reinforcement learning through information gain maximization","venue":null,"work_id":"e11825b3-511d-481c-98b5-29cc2fa9474d","year":2025},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.635219Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:d18fbaef3f2e3f41bcd2d5f82450ace99b1a4c231eb357614dec805aac587804","observation_id":"4d92d76f-80a5-4dc5-9d43-0693b7e3567e","resolution":{"observed_at":"2026-08-06T14:48:54.840199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:54.610325Z","title":"Sutton and Andrew Barto","venue":null,"work_id":"563b8949-4c90-4088-9382-0a10dabd1817","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.716178Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:a77e8011b2f85b0da0beb32a2bde5b247984e3e9f53f15706f3775aaead52d82","observation_id":"9f2931ef-91ed-4c19-9777-88dfd6d5e8e6","resolution":{"observed_at":"2026-08-06T14:48:54.668222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:51.798344Z","title":"Improving deep reinforcement learning by reducing the chain effect of value and policy churn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.798344Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:608488d0a9c0dd696e64379a447f7dbd41beea06e67ce6ab9650b3cd04565193","observation_id":"3acf0046-0b42-41dd-8def-cac57e2a55b3","resolution":{"observed_at":"2026-08-06T14:48:51.798344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:51.925909Z","title":"MuJoCo : A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:51.925909Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:8094de3005ea125ce48807b19c1d00fed6fe88557caed8c9c38a4691f78c983a","observation_id":"7658bc7e-8099-4ad4-8afb-4a365f10451b","resolution":{"observed_at":"2026-08-06T14:48:51.925909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-06T14:48:52.022023Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.022023Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:fa78a25b784ad699b36eeb4ba2bf0a1d7e660254f0f196eed67a4c49c349776d","observation_id":"9d4d48f1-3bb7-4255-a172-039e321357a0","resolution":{"observed_at":"2026-08-06T14:48:52.022023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T14:48:52.137791Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.137791Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:97402603996035e99965f72729b1031c4769510f213e6b4964ce31441e30f264","observation_id":"b9178950-d006-48d7-84c0-46e344cce11d","resolution":{"observed_at":"2026-08-06T14:48:52.137791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10959","last_updated":"2020-02-24T23:25:50Z","snapshot_observed_at":"2026-07-06T07:17:20.813296Z","submitted_at":"2018-11-27T13:17:45Z","title":"Dataset Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10959","snapshot_observed_at":"2026-08-06T14:48:52.204307Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.204307Z"},"links":{"cited_paper":"/paper/1811.10959","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:bdda77f21cd16f16e1f5bf88e98c629a6607c3a76d671556def1a8812f85a274","observation_id":"8f07cb6a-ce7b-45e4-8917-29771434a0ae","resolution":{"observed_at":"2026-08-06T14:48:52.204307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1106.4487","last_updated":"2011-06-22T15:55:52Z","snapshot_observed_at":"2026-07-06T02:29:42.096427Z","submitted_at":"2011-06-22T15:55:52Z","title":"Natural Evolution Strategies","version":1},"cited_work":{"arxiv_id":"1106.4487","doi":null,"metadata_source":"pith","pith_arxiv_id":"1106.4487","snapshot_observed_at":"2026-08-06T14:48:53.056924Z","title":"Natural Evolution Strategies","venue":"stat.ML","work_id":"a7fa61bb-d119-4d3f-a2ac-9af3539280c0","year":2011},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.287410Z"},"links":{"cited_paper":"/paper/1106.4487","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:b1cf8a5e1e939bd8c02a0134269cf55582d92e6553d70d6653ef054d174ba65f","observation_id":"59339402-f08a-4723-bd2c-7434f8185b54","resolution":{"observed_at":"2026-08-06T14:48:53.127951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:54.432257Z","title":"Understanding short-horizon bias in stochastic meta-optimization","venue":null,"work_id":"7321d76c-5ee5-4ac6-baa7-043c7c138593","year":2018},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.381492Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:106496c563dbc453aa47924b371a11e9c8c46e99463a362fc1e5528ee4d72994","observation_id":"985ed171-fb21-495a-b2b0-84d329f3aa4b","resolution":{"observed_at":"2026-08-06T14:48:54.523597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-06T14:48:52.488734Z","title":"MinAtar : An atari-inspired testbed for thorough and reproducible reinforcement learning experiments","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.488734Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:eebcbace42855134262ea4fca0018940cfb71b81ee1b9315f6d5460157bd1004","observation_id":"1e7ab7c4-6b5d-4d2a-8ff5-7a5056aac1b8","resolution":{"observed_at":"2026-08-06T14:48:52.488734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:54.298193Z","title":"Self-distillation as instance-specific label smoothing","venue":null,"work_id":"b3b87c8c-f475-49b2-8b89-837a74c1669b","year":2020},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.573001Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:7c28b8c6c9d905a095312110c90a14fc953e9b34621ca45da6f0a03349bc5768","observation_id":"cc47c1d0-9afe-4395-bec3-813cad431c96","resolution":{"observed_at":"2026-08-06T14:48:54.343900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06578","last_updated":"2022-05-07T00:44:36Z","snapshot_observed_at":"2026-07-06T12:47:13.259135Z","submitted_at":"2022-03-13T06:04:25Z","title":"Symbolic Learning to Optimize: Towards Interpretability and Scalability","version":4},"cited_work":{"arxiv_id":"2203.06578","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06578","snapshot_observed_at":"2026-08-06T14:48:52.904366Z","title":"Symbolic Learning to Optimize: Towards Interpretability and Scalability","venue":"cs.LG","work_id":"cc97294d-9244-4533-a26c-d69db8e02c80","year":2022},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.681440Z"},"links":{"cited_paper":"/paper/2203.06578","citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:263d346ff6b3ec713b8209ce4166ebe3490f639b38c174b2b7dca3266a534a39","observation_id":"44945f70-98c5-4abf-b02c-65bc7fd38f80","resolution":{"observed_at":"2026-08-06T14:48:52.957731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:48:52.758471Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T14:48:52.758471Z"},"links":{"citing_paper":"/paper/2507.17668"},"observation_digest":"sha256:0e5757043a01a9e9c8d0386bdb9baed0b3884de0e10b3bfd3eae3775b02df2d9","observation_id":"41439ad1-985a-4ebb-b5bf-0348a9646f81","resolution":{"observed_at":"2026-08-06T14:48:52.758471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17668","last_updated":"2025-09-10T12:25:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T15:32:47.481175Z","submitted_at":"2025-07-23T16:31:38Z","title":"How Should We Meta-Learn Reinforcement Learning Algorithms?"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":53,"verified_exact":4,"verified_fuzzy":26},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 1 inbound Pith citation observation for arXiv:2507.17668."}