{"as_of":"2026-08-12T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69be34600e27b1657db659c5827888c62bc02b86c230138340d1499fb49cf53e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:27:17.314011Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03068/citation-record","integrity":"/paper/2507.03068/integrity","json":"/paper/2507.03068/citation-record.json","paper":"/paper/2507.03068"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.142182Z","title":"A simple environment for showing mesa misalignment","venue":null,"work_id":"ced84c21-3474-4839-8c51-2394545c2072","year":2019},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.074241Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:a6099515e3b61e05f715db19827775e586db9c437d854458fde35917ef3f270c","observation_id":"3c5e9aa3-8975-4a9c-aa38-53b02645ad48","resolution":{"observed_at":"2026-08-06T20:27:18.146513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.127688Z","title":"Foerster","venue":null,"work_id":"adac1657-ce59-4073-8bdb-704906b4facd","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.082522Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:d95ad8f4553ed5b3182adabd92f3084cb98b9d2fe5cf8535dd24dc67428fecd1","observation_id":"ae9d9081-05e5-45d9-a367-052492924efd","resolution":{"observed_at":"2026-08-06T20:27:18.131884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.113432Z","title":"JAX: composable transformations of Python + NumPy programs, 2018","venue":null,"work_id":"9f0fffab-a2f4-4575-9509-3a08dcab9080","year":2018},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.088351Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:6788dee9aa83bb22b57964b2b96c38a0e8ae0ee35bf68b04891f4cd72bfeb12d","observation_id":"392fc6b2-0233-4031-a1be-78b04425b299","resolution":{"observed_at":"2026-08-06T20:27:18.117890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.096374Z","title":null,"venue":null,"work_id":"26c864e7-2196-4fa9-949a-b440ecb3affd","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.096168Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:03ab01059b033f40a39cfe2c4ba3576dac731cdc0ffc6e959d694196719856eb","observation_id":"7d02b7f8-3840-4c15-b8e3-0143e1c0ad72","resolution":{"observed_at":"2026-08-06T20:27:18.100899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.079303Z","title":"Techniques for optimizing worst-case performance","venue":null,"work_id":"2f4f9a8e-005f-450a-938a-f4e3273905cc","year":2018},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.101608Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:d3f4978dd9b371403304cb3ed6d26f3a593fbf0cac6378421598992a6a61f1a2","observation_id":"d5348070-d25d-4dfa-b3dd-81dabaa35b10","resolution":{"observed_at":"2026-08-06T20:27:18.083878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.064265Z","title":"Quantifying generalization in reinforcement learning","venue":null,"work_id":"6c417bd1-2a26-4ab1-8321-31922cde2a09","year":2019},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.106734Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:2689c3b4eda822e64e403f062d2ef364f92fe0075ffba948bb0ee31a85b6461d","observation_id":"ced89587-d614-4c3b-b16e-c83b1cf3ca75","resolution":{"observed_at":"2026-08-06T20:27:18.068706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.048252Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"92fbeb1e-041a-44a1-9f92-36eb0fe77ff2","year":2020},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.112730Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:0ea81909b98c3e736d239dd40bde2e84bffc8813cf2610217821e0dd854ef66e","observation_id":"489e7187-c700-4de6-bab2-adc6ce09200e","resolution":{"observed_at":"2026-08-06T20:27:18.052886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.032432Z","title":"Russell, Andrew Critch, and Sergey Levine","venue":null,"work_id":"488b96c6-abad-44d1-8ef2-1086b957e4f0","year":2020},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.117890Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:9e1785bd96983cb82415b3b894c3a7c1ba95387f8e586345e17bc34d3d43a44b","observation_id":"1295f80c-b5bf-4c57-adf2-fa292fa3b3f8","resolution":{"observed_at":"2026-08-06T20:27:18.036711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:18.015073Z","title":"IMPALA : Scalable distributed deep- RL with importance weighted actor-learner architectures","venue":null,"work_id":"6bfd323f-bc80-43b0-8a27-5fac40f46259","year":2018},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.123201Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:6f098818cdd4ab594dcf05bb4f90a7751f79a008cdbff807ab00ca615036682b","observation_id":"8a2d1989-dabd-4cf5-af10-5a63c3013f7d","resolution":{"observed_at":"2026-08-06T20:27:18.020421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.997935Z","title":"Wichmann","venue":null,"work_id":"3119ac99-7165-469a-a389-77c296015743","year":2020},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.127937Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:08af4ebf2640d086665d0e873d4d6034636ecf0a3852def88e7cc60464b7bbc6","observation_id":"6a485573-2783-4884-811a-281d3a895edb","resolution":{"observed_at":"2026-08-06T20:27:18.003171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.974846Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"f5d63d48-c38f-4e73-afca-df0ef885097b","year":2018},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.132546Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:92873d0d7d8b65819be710c4e4312cd6614f4c52680bee8807d971c60973faa4","observation_id":"ed020618-ae60-402f-b500-68c1cf58e67b","resolution":{"observed_at":"2026-08-06T20:27:17.985706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.949120Z","title":"Russell, and Anca Dragan","venue":null,"work_id":"1c242878-a4f7-4028-b867-62cb756dd154","year":2017},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.137477Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:3e4e3de1bb631e604984ee2ce4c632d87fdc34a125b01e61192d11b00338d312","observation_id":"b720f29d-d32e-4e3c-bdb2-f2d29a272610","resolution":{"observed_at":"2026-08-06T20:27:17.957840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.929586Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":"b1d72783-305d-4d69-918d-a5cebb7beeda","year":2020},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.144895Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:0fa32033461c79b841f5540c4cb01e6576ed82d8f498d1c9b8e3c383038aec80","observation_id":"e57cad4d-3df2-46c8-8d15-e0604e5be394","resolution":{"observed_at":"2026-08-06T20:27:17.934390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.913374Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":"d5c845cc-5bb3-4b45-b45b-9247c8570130","year":2025},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.149652Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:ee8b865ae67e89f275b049877eda5e14bb7434be0788d2e4d60f41e0ba732d21","observation_id":"e9aa0058-49ce-4e48-a06e-340e3e3438d2","resolution":{"observed_at":"2026-08-06T20:27:17.918960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.895672Z","title":"Towards an empirical investigation of inner alignment","venue":null,"work_id":"b3f73be9-84d2-463a-be10-75da4c137f60","year":2019},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.154463Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:1661c26d4e758e41d0a0a5f8cbb090e0000d7692c2636996f9df7e869f74fd16","observation_id":"67f86d99-5c2e-4b9b-b753-9eb4e2a7fb8d","resolution":{"observed_at":"2026-08-06T20:27:17.900729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.876487Z","title":"Foerster, Edward Grefenstette, and Tim Rockt\\\" a schel","venue":null,"work_id":"db13cc78-00aa-4b60-9d3a-48b9a0d6027f","year":2021},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.160077Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:0cdbad2252ece77d151dfd0350a3f53371346774bac98e3dfb252322b200b309","observation_id":"2ca15f77-ab8f-4340-be67-11ce4dd1207f","resolution":{"observed_at":"2026-08-06T20:27:17.882434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.857833Z","title":"Prioritized level replay","venue":null,"work_id":"b2f5914a-fea4-4574-9788-b530c838553c","year":2021},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.165739Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:301ee6ae8e878c02e33dc3908923a06d88bfa0c31b657c21009c00cf8e22b79d","observation_id":"6f460851-239a-45ca-8c3c-bc03249a1f7e","resolution":{"observed_at":"2026-08-06T20:27:17.863103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.171331Z","title":"A survey of zero-shot generalisation in deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.171331Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:13e6b2b9fdc817ff74b9eb3cd4648f575e07a399abb2a44324b9d845fba5e1e2","observation_id":"6366e52c-95ed-4dd7-9dbd-97804f00f2f4","resolution":{"observed_at":"2026-08-06T20:27:17.171331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.828925Z","title":"RMA : Rapid motor adaptation for legged robots","venue":null,"work_id":"fed083df-dc05-4848-a134-49dd404bb69a","year":2021},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.176492Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:004a1227ee3d574b66c7204ff024ad20754bdab67e25268cb4ef6b0eacdc8830","observation_id":"c42c1d75-433a-4f0d-8008-4d1cc297c9ca","resolution":{"observed_at":"2026-08-06T20:27:17.834352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.809388Z","title":"Sharkey, Jacob Pfau, and David Krueger","venue":null,"work_id":"ec4f2ecd-c8d6-463e-aa67-9c796018c07f","year":2022},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.183732Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:5525db7de72f7e2e31bcc8cdb6e10e7080bff66887f58c26d5204c78d2d479e6","observation_id":"e5d0c10b-b9ef-402e-a65e-132cc0bec9ca","resolution":{"observed_at":"2026-08-06T20:27:17.816978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.790717Z","title":"Liu, Behzad Haghgoo, Annie S","venue":null,"work_id":"f89fd64b-d8ff-42d0-9729-881e4304f9db","year":2021},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.188462Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:0acf99535bf3fd0dcfd8fac9bf754fe14c20aafa73181dcb4f5aa7771277f30f","observation_id":"fbe9e9bc-eac9-43ad-b265-605393edfd03","resolution":{"observed_at":"2026-08-06T20:27:17.797232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.772425Z","title":"DrEureka: language model guided sim-to-real transfer","venue":null,"work_id":"e1b26082-cf0b-4f0e-9330-d332fc541ab8","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.193379Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:e8e9a4d607f25de5f1b495567f0a2792e9d28f0c96a5bea6cb6980798e278bdd","observation_id":"c5754977-483e-4aaf-a8d5-278e88b255df","resolution":{"observed_at":"2026-08-06T20:27:17.777439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.757689Z","title":"Isaac gym: High performance GPU based physics simulation for robot learning","venue":null,"work_id":"88ebb852-34a9-4fcd-b5df-cc2826dcb9ab","year":2021},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.198483Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:43f3e7e94f7e56b4632b72762cb6b7fade8d89c9deb5ea949f723461303cff4e","observation_id":"5033d175-c8c1-49fb-9978-10e4cb601e7e","resolution":{"observed_at":"2026-08-06T20:27:17.762487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.742700Z","title":"Foerster","venue":null,"work_id":"b403e0c4-d7c0-4500-aaac-5be75acfc014","year":2025},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.203833Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:cc6832c4e2541e14931869fe97e45d85e4fddc4b08be2988681e244150642fc9","observation_id":"ff4e2382-3b34-404d-b548-139318cfae09","resolution":{"observed_at":"2026-08-06T20:27:17.747484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.728002Z","title":"Robot learning from randomized simulations: A review","venue":null,"work_id":"bfc3ae26-beac-4620-ad16-875285ebcd46","year":2022},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.208848Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:a532cffa51a92c44e750e5840b5767dcd742025d9d88261d83f309722d536f80","observation_id":"d0d5c9fd-9076-456d-b0f6-77cb5f1f51ab","resolution":{"observed_at":"2026-08-06T20:27:17.732964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.709078Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":"576694c2-1a7c-42fc-a4c3-b6c9870d35d3","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.213900Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:8064953bdad0ec0d242bbb7be37da18d7cb4ed9e545f9e09bae9df7dceda5cc1","observation_id":"ce2b43a3-35f6-415f-bd62-0508f759b8d9","resolution":{"observed_at":"2026-08-06T20:27:17.716476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-06T20:27:17.222302Z","title":"Solving Rubik's Cube with a robot hand","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.222302Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:e2c52520dcb98aef2fbaf938c2c9c9ca2c615348e9fb1163e7cc0f91f00ca97a","observation_id":"803b8f12-2443-4786-ad95-a7fdc62338b6","resolution":{"observed_at":"2026-08-06T20:27:17.222302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01302","last_updated":"2023-09-30T18:36:42Z","snapshot_observed_at":"2026-07-06T12:43:24.521815Z","submitted_at":"2022-03-02T18:40:00Z","title":"Evolving Curricula with Regret-Based Environment Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01302","snapshot_observed_at":"2026-08-06T20:27:17.230526Z","title":"Foerster, Edward Grefenstette, and Tim Rockt \\\"a schel","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.230526Z"},"links":{"cited_paper":"/paper/2203.01302","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:47554b9d0ca1bc0676e65ce43fb44019f11c7d76c51d7039a834a0102108185f","observation_id":"1e6a6b16-6bb8-4077-bdcf-f306787a0b71","resolution":{"observed_at":"2026-08-06T20:27:17.230526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.684396Z","title":"Sim-to-real transfer of robotic control with dynamics randomization","venue":null,"work_id":"79a10ed0-893d-45a3-ae80-9b44fe3d84d5","year":2018},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.236263Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:f4bf0d36ea64f46fd5a1d8beeaed55c0393cd84c72028f906a27b7e7a13933ca","observation_id":"1eebb96e-7e39-46bb-80d6-036bc92aed2a","resolution":{"observed_at":"2026-08-06T20:27:17.691185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.666734Z","title":"No regrets: Investigating and improving regret approximations for curriculum discovery","venue":null,"work_id":"0c5756ed-cf79-4e46-a57f-2d5a65033d2f","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.241584Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:7528d94ee07b4fd854d79c410cf99bd489d1c5542a58157ec33275930443b26c","observation_id":"64cd1e51-9f36-4f4d-92fe-083e554b546a","resolution":{"observed_at":"2026-08-06T20:27:17.671584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.648176Z","title":null,"venue":null,"work_id":"8e09e484-660d-4691-aa2b-aded6ac6d6d5","year":1951},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.246342Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:590d64e44c8c05cae58b9d56d4de2f5ae10de8913a8e6eea67596fcae46abd23","observation_id":"603ddbb2-8363-4472-825d-c0ecb9ffee74","resolution":{"observed_at":"2026-08-06T20:27:17.654276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.632418Z","title":"Mastering Atari, Go, chess and shogi by planning with a learned model","venue":null,"work_id":"08311c62-2439-4cfe-becf-9e53a33f71fc","year":2020},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.252609Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:422692662c55ee2fc39ac64e94639b63d4b69447b7939cc403e7a2e5de688540","observation_id":"208cf76e-b46b-4098-a7f7-07cfde7403db","resolution":{"observed_at":"2026-08-06T20:27:17.637445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T20:27:17.257646Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.257646Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:135f21eb5c08a30d77bdbb3bf87f76ae2e9495cb866b84e7cd7b06ee3ec59624","observation_id":"e2a763a1-b8fe-433a-9674-33a9a7608ce3","resolution":{"observed_at":"2026-08-06T20:27:17.257646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T20:27:17.263987Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.263987Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:7253415ef73e050ece703b162a02d46f8969501ccf8da08f831806399d945cb3","observation_id":"4a300134-3136-4500-a7f8-769628c09c6a","resolution":{"observed_at":"2026-08-06T20:27:17.263987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01790","last_updated":"2022-11-02T16:19:04Z","snapshot_observed_at":"2026-08-10T13:33:42.011791Z","submitted_at":"2022-10-04T17:57:53Z","title":"Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01790","snapshot_observed_at":"2026-08-06T20:27:17.268826Z","title":"Goal misgeneralization: Why correct specifications aren't enough for correct goals","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.268826Z"},"links":{"cited_paper":"/paper/2210.01790","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:28b7622136b337bf14356266061ed37f24b5fced0a3b4fe8095abfc7356c5f01","observation_id":"d89b77a1-e7f6-46bb-81c3-f37439138105","resolution":{"observed_at":"2026-08-06T20:27:17.268826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.614194Z","title":"Addressing goal misgeneralization with natural language interfaces","venue":null,"work_id":"faac7d22-f342-47ee-a8bf-57f96c82aef4","year":2023},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.275390Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:aaab7e4fde58c9163aeb14914ce86fa92aea0e5caebe809e5136d51ec8691328","observation_id":"84d7baa5-3f42-485b-96eb-ba68a92bca12","resolution":{"observed_at":"2026-08-06T20:27:17.620046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.586775Z","title":null,"venue":null,"work_id":"243aa8a8-8cb5-44b1-bc03-984b662dbad7","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.281308Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:b91bf1a9531cb0273d2be7e4512ea53a63ed47e2b72e5fee660883c97c0256de","observation_id":"44f3a071-e9db-4215-9f9f-8e936579e7d9","resolution":{"observed_at":"2026-08-06T20:27:17.593711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.567636Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":"ec7d5bff-80fb-4c7f-80c0-58e8d5449f93","year":2017},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.286777Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:09bd265e1e5322db12a0a33979d68dc3dd9bfb8e75f1dbe02b1894f1f3840e4e","observation_id":"66efe68e-1882-451f-bce3-752ba78d3f53","resolution":{"observed_at":"2026-08-06T20:27:17.572789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21052","last_updated":"2024-11-10T05:36:32Z","snapshot_observed_at":"2026-07-06T19:40:48.425432Z","submitted_at":"2024-10-28T14:07:41Z","title":"Getting By Goal Misgeneralization With a Little Help From a Mentor","version":3},"cited_work":{"arxiv_id":"2410.21052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21052","snapshot_observed_at":"2026-08-06T20:27:17.376356Z","title":"Getting By Goal Misgeneralization With a Little Help From a Mentor","venue":"cs.LG","work_id":"8c5dfd5c-6c52-4b9e-a941-70deba7a9cda","year":2024},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.292150Z"},"links":{"cited_paper":"/paper/2410.21052","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:774cdcc02c0ea2684c2289a5c1a3de13c6ddd64ea5a26c49f38a51515355b18d","observation_id":"e6e9d5ee-9e6c-4356-99f5-46f0e8a1e653","resolution":{"observed_at":"2026-08-06T20:27:17.389242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.548610Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":"a67c7c45-e5e5-4630-ad13-af63808a5319","year":2025},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.298351Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:b66818bf45bb4d76100f0edabed567b6ad7aa5a47c80e02769043dd3d83544eb","observation_id":"2b904fbf-57f6-4c62-8dbd-c5af57d8c477","resolution":{"observed_at":"2026-08-06T20:27:17.555701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09018","last_updated":"2025-08-24T21:17:07Z","snapshot_observed_at":"2026-08-10T09:23:00.499527Z","submitted_at":"2023-11-15T15:02:23Z","title":"On the Foundation of Distributionally Robust Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09018","snapshot_observed_at":"2026-08-06T20:27:17.303633Z","title":"On the foundation of distributionally robust reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.303633Z"},"links":{"cited_paper":"/paper/2311.09018","citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:c478d04c2368f8c1296b7ae116f60be804adf60ad9adf45e99e6a86fc7f5d352","observation_id":"3ccb9edc-595e-4760-bcf0-b88be9f14093","resolution":{"observed_at":"2026-08-06T20:27:17.303633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.529169Z","title":"Sohoni, Hongyang R","venue":null,"work_id":"8827694d-c29b-4af7-807b-2659bd5611a4","year":2022},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.309240Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:7b6c831dbb9d4cc48d8cbdee842123386ce8d11426d49e947b1468c49f70359c","observation_id":"732ca401-2b25-41bf-ab90-a7b570976a40","resolution":{"observed_at":"2026-08-06T20:27:17.534368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:27:17.499123Z","title":"Consequences of misaligned AI","venue":null,"work_id":"d8a826ed-c288-4505-8b1f-38a04a07891b","year":2020},"citing_paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:27:17.314011Z"},"links":{"citing_paper":"/paper/2507.03068"},"observation_digest":"sha256:0b669c3aa5abf62f817d719347c7e55a2cda6eae5ee49366963413da686bdf26","observation_id":"19bb1a2e-75f6-4205-a684-b648921899fa","resolution":{"observed_at":"2026-08-06T20:27:17.506689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03068","last_updated":"2025-07-18T07:38:55Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T21:42:50.234286Z","submitted_at":"2025-07-03T17:57:12Z","title":"Mitigating Goal Misgeneralization via Minimax Regret"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.03068."}