{"as_of":"2026-08-17T17:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d2e982c088851c89addbecf4bf9018df4df2c3e542694651c24e4d20569a4af","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:35:59.796489Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11457/citation-record","integrity":"/paper/2411.11457/integrity","json":"/paper/2411.11457/citation-record.json","paper":"/paper/2411.11457"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.608437Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.608437Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:67834aeae80fa178a694b601f4b57fdb2c2ef8da4b7e44f502209a75c0cb66d5","observation_id":"2bdfe559-f9ee-4bae-a6cd-366433b95602","resolution":{"observed_at":"2026-08-12T18:35:59.608437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.395504Z","title":"and Mishra, S","venue":null,"work_id":"8ecdc4b2-52b3-419c-bfe6-9e4fea585083","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.614212Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:f25a6aa63b2af4bc038d582a967f81cf3cc9693743ffbbbec5109a582bc78b78","observation_id":"abb3a62d-6a64-41a0-8675-4821a0df9f8f","resolution":{"observed_at":"2026-08-12T18:36:00.399198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.383978Z","title":null,"venue":null,"work_id":"5b64ee6e-9e6b-438e-9bda-3d05f12e5ee1","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.619203Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:04f94f341271ce566c2d308ec1ae9b919a81d209411776f450adf7cb56de0333","observation_id":"a29ac238-2445-4f64-a265-a146a823f43f","resolution":{"observed_at":"2026-08-12T18:36:00.387963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11960","last_updated":"2022-02-24T08:44:11Z","snapshot_observed_at":"2026-08-16T17:19:00.226123Z","submitted_at":"2022-02-24T08:44:11Z","title":"All You Need Is Supervised Learning: From Imitation Learning to Meta-RL With Upside Down RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11960","snapshot_observed_at":"2026-08-12T18:35:59.623576Z","title":"R., Schmidhuber, J., and Srivastava, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.623576Z"},"links":{"cited_paper":"/paper/2202.11960","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:f05c5cb35d1276a81e42a37c868f13fd506515a9790fbe48d3bbf65991a10c36","observation_id":"5f06d254-b2f7-44b0-9c53-1105dd80dc89","resolution":{"observed_at":"2026-08-12T18:35:59.623576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12742","last_updated":"2022-05-10T13:05:58Z","snapshot_observed_at":"2026-08-17T12:53:58.877626Z","submitted_at":"2022-02-23T07:21:44Z","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2202.12742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.12742","snapshot_observed_at":"2026-08-12T18:35:59.918644Z","title":"Learning Relative Return Policies With Upside-Down Reinforcement Learning","venue":"cs.LG","work_id":"ef71614a-5271-4cb9-ace0-e19bfef20cf2","year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.627958Z"},"links":{"cited_paper":"/paper/2202.12742","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:7fc8943f497aef56cdd371a39987caa34cfedfe78c23eca8dddf773bbbdbd3a3","observation_id":"d8711a58-671b-4cde-9fb0-e2c312369abd","resolution":{"observed_at":"2026-08-12T18:35:59.922846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.370938Z","title":"G., Sutton, R","venue":null,"work_id":"98b4c8dc-f3ed-4d1b-a5cc-dca5b81ee200","year":1983},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.632421Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:5b0dff52d3586aa6dc975b2e7677a4a19fdedc66be6c019da34fae9246b5d5b2","observation_id":"4d3df4d2-cb04-4778-a7ac-f2f997510db1","resolution":{"observed_at":"2026-08-12T18:36:00.375535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.636180Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.636180Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:31e3aeec499f0561617aef591e7bc829fa6a7b8be5a57f2df89f4a9fb3fe7e2b","observation_id":"356fc9e3-a00e-43f0-8fe1-b43b19252053","resolution":{"observed_at":"2026-08-12T18:35:59.636180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.351574Z","title":null,"venue":null,"work_id":"ddf7fa39-0e37-47ff-95ef-a8ddb2731106","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.640291Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:57522d1a9d052929f9f578dcdc72356316742c642a918676a3407adba1f41736","observation_id":"fb3827f9-b6af-4954-a12f-8b0c649e1fbb","resolution":{"observed_at":"2026-08-12T18:36:00.356335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.338952Z","title":null,"venue":null,"work_id":"a41ef5c9-fd1a-4bd5-9856-3d05a9b09da5","year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.644021Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:cd7c0bab39b494b13b47749e00539454e50c0568895898af0502db394ed6f890","observation_id":"7f6b6e94-cfb7-4d46-9236-d7c4e1798352","resolution":{"observed_at":"2026-08-12T18:36:00.343117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.326755Z","title":null,"venue":null,"work_id":"07d71bf0-12dc-4402-aef9-39e4b5e7a500","year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.647621Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:e3828838ed9e8b8260dabba83e15c9f8cea28d01120b2b7f52bbeb01e1dd057d","observation_id":"d21af92e-d3c8-4ea6-b0ca-c53355df626d","resolution":{"observed_at":"2026-08-12T18:36:00.330895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.314524Z","title":null,"venue":null,"work_id":"057d1bdc-9623-48b2-8bf1-ff1add56885c","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.651418Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:d8cf7fb9c825ea57d8c490ec4c84ebcbc20332dbabfa09c325e74c9752e86287","observation_id":"805e1cfb-34f3-4478-b0a6-caa6085156b5","resolution":{"observed_at":"2026-08-12T18:36:00.318334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.301298Z","title":"and Hart, P","venue":null,"work_id":"2e388c93-4409-4bb9-85c3-4b1d608a6bd8","year":1967},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.656560Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:9a14251f7322311836d2d603253ec281f822b36bcbb33a08e2d4b756cee0a359","observation_id":"c303bfe3-5043-4dc1-bc5e-94e1c89e15a4","resolution":{"observed_at":"2026-08-12T18:36:00.305489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.661138Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.661138Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a69af39585b681db431259cd8dc0e44d0728eab408a676afd6a352fa565cf7f8","observation_id":"0291fb40-5715-4138-b17e-695f96393908","resolution":{"observed_at":"2026-08-12T18:35:59.661138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.280232Z","title":null,"venue":null,"work_id":"2faedadc-78d0-474a-af7b-da628a5bf535","year":2005},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.664712Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:c0f6b583f135ae476cd705b6329a6d940141362ba751f99a072b563306203ce6","observation_id":"a8b6ea7f-fc98-4de4-9809-652779e16cb0","resolution":{"observed_at":"2026-08-12T18:36:00.284611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.268317Z","title":null,"venue":null,"work_id":"6fa03dec-31ad-4083-9241-c8c132b29abb","year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.668061Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:1ca8409250ce9676118bd94e5703b15efc7f3aef2ef750880698a36ea3c7a5bd","observation_id":"5c374c7d-2122-4422-8d62-101f6fee61e1","resolution":{"observed_at":"2026-08-12T18:36:00.272324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.255954Z","title":null,"venue":null,"work_id":"92ae350d-e51c-4d00-910f-0593e7608b2a","year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.671467Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:93b5dcc85a552182f2b0ed72eab4aadc218259a836c922eeffcfbea45688560d","observation_id":"e2ae35d7-bfd2-4d5d-b482-327d410a24d3","resolution":{"observed_at":"2026-08-12T18:36:00.260146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.243053Z","title":"E., et al","venue":null,"work_id":"9c741e49-a87b-446a-8af7-8f73dfc2df00","year":1996},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.675111Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:5b7bef0f1cd4290c6e0e05ec40aca54560c61407865e5ad2602fb2a39d72d382","observation_id":"afa1af9c-2172-4f6a-a10f-d1fcd82c4cfb","resolution":{"observed_at":"2026-08-12T18:36:00.247060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.678651Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.678651Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:e5718809b94c1daacab7ed189df20779dfda71df73954fb71d756c00aa4ca696","observation_id":"c747cf82-8295-4991-a24c-1f977f7eccfe","resolution":{"observed_at":"2026-08-12T18:35:59.678651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-08-16T17:40:36.764753Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-12T18:35:59.682047Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.682047Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:13401c2f858dbb4fc31d749e6793061dbfa5000925fd54a29955d82dad0142e2","observation_id":"946b6186-11c2-4f8a-97e6-e932345ed70f","resolution":{"observed_at":"2026-08-12T18:35:59.682047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.686181Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.686181Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:aec88638e565901383814b128bca79de1c4f4ffbb354dc2f993b187e4d0fd238","observation_id":"becba9f6-d4e7-47b3-b584-eaca283b99b6","resolution":{"observed_at":"2026-08-12T18:35:59.686181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.217202Z","title":null,"venue":null,"work_id":"bb95464f-9b36-454f-88a1-42c7a0e3b1fc","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.689567Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:9bf7ca21bdd8adf648bbf04f0a28568c83b3f5f207a036ef73a515e4309a1cbf","observation_id":"fdef25be-0db2-4f12-a82d-bc3adcb58a4e","resolution":{"observed_at":"2026-08-12T18:36:00.221200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.205065Z","title":null,"venue":null,"work_id":"0b944d46-65cb-4dc5-b12b-cf9c0c95ce6a","year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.692976Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:d826f6bc32abfcaac9346c33ff1dcc3ea558129f58c10e3d6aa42618c5f5a4f8","observation_id":"302823e9-b521-4a8f-919c-2d8d23f4a813","resolution":{"observed_at":"2026-08-12T18:36:00.208953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.192686Z","title":null,"venue":null,"work_id":"e7c7ae9b-c2c4-465e-8160-9ed5c235dbf7","year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.696297Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:d04cd6a57a73080b562788e4f8bba3f632d39b76ba193328cbf72aac227aa4cc","observation_id":"8ca6e5eb-2068-4c52-aa7a-acf85b2f1f75","resolution":{"observed_at":"2026-08-12T18:36:00.197096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.699667Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.699667Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:5a5c2e12f4aa69c4c398a9de8d0158edfb559a27fd80a579ac052fdbf4458f83","observation_id":"5a6a0b13-8e32-4fc3-b387-3ee9ae08df0d","resolution":{"observed_at":"2026-08-12T18:35:59.699667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.172418Z","title":"G., Pisane, J., Kolios, A., and Ernst, D","venue":null,"work_id":"037b00a4-91a6-408d-8c2e-875614d52653","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.703145Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:0b486ced91bcb5e6280e58c8e658aac5458ab4b86cc3f9a91c79d73ba8eb8d04","observation_id":"203b2ee3-f44c-41ef-8dac-d0c729cbe1bd","resolution":{"observed_at":"2026-08-12T18:36:00.176905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08299","last_updated":"2022-09-02T10:46:40Z","snapshot_observed_at":"2026-08-16T17:27:02.445517Z","submitted_at":"2022-01-20T17:06:42Z","title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08299","snapshot_observed_at":"2026-08-12T18:35:59.706912Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.706912Z"},"links":{"cited_paper":"/paper/2201.08299","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:b8acec569ccf0b8ca89148a6b96f9ddf7798a1458b4d3c5727c48eba45cae399","observation_id":"4b876560-7f52-4f3a-b377-c66222a2351a","resolution":{"observed_at":"2026-08-12T18:35:59.706912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.160594Z","title":null,"venue":null,"work_id":"638daf44-f510-499a-86e2-a8adf6b4dfd5","year":2013},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.711006Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:e577cceaccc54b1302b7bf086d7602d7e23ca03af70bfd451af34aa25a01bbb3","observation_id":"00a8459a-452e-49f8-934d-8147ed3222b6","resolution":{"observed_at":"2026-08-12T18:36:00.164422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.148290Z","title":null,"venue":null,"work_id":"97b9378b-119a-4eec-b823-17045a4bbe33","year":2005},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.714854Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:107cf59b66c64ad84994469f66183012e2bcecd1a65ae4e46c080827f90c7ded","observation_id":"b4402b34-2019-4601-9143-c974431e8000","resolution":{"observed_at":"2026-08-12T18:36:00.152815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.136392Z","title":"A., de Lope, J., and Maravall, D","venue":null,"work_id":"936198ff-c48a-4976-b82c-d13f2ac89c91","year":2009},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.718392Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:b201ea1dbddbf5407d070f931b727ef67704d6797d24a6b5e759c78cd96d4e6c","observation_id":"4d233def-ac71-4df7-b44a-b982ce9c86c8","resolution":{"observed_at":"2026-08-12T18:36:00.140298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03771","last_updated":"2022-04-07T23:00:39Z","snapshot_observed_at":"2026-08-16T17:08:26.184760Z","submitted_at":"2022-04-07T23:00:39Z","title":"Q-learning with online random forests","version":1},"cited_work":{"arxiv_id":"2204.03771","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03771","snapshot_observed_at":"2026-08-12T18:35:59.876718Z","title":"Q-learning with online random forests","venue":"stat.ML","work_id":"4f60ee94-e650-4ff3-88b1-cb7a42954729","year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.722299Z"},"links":{"cited_paper":"/paper/2204.03771","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:fd5e06a9044b3693a24a0c54c0e5f269ff0bc922bfaeaf5a2cb48acbd426f799","observation_id":"1a1af645-6662-47f5-99ce-265f2350f2bd","resolution":{"observed_at":"2026-08-12T18:35:59.882991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.124067Z","title":null,"venue":null,"work_id":"1a74bfd3-a783-4f4c-bac4-0d6030242ca1","year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.726465Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:ff31ba230163a22af7aa08c7fb24ddaf94888bac730598980813b02563d7e846","observation_id":"7ceaf3c9-5804-4fa8-b4d8-1ad46ccde549","resolution":{"observed_at":"2026-08-12T18:36:00.128061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.112663Z","title":"J., and Moyà-Alcover, G","venue":null,"work_id":"a6161eea-7392-495c-a0fd-b3f65b6ae95e","year":2025},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.730152Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:8ae247afe0817167d964e11caf015dfea03fbaafee220cb3d96c2c5da4a03545","observation_id":"d3a0bc44-5ee8-4a3e-addf-3c405e51ff49","resolution":{"observed_at":"2026-08-12T18:36:00.116517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.100542Z","title":null,"venue":null,"work_id":"bfe436f5-abde-4ded-be62-0e0ce2f539c5","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.733683Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:f59dade423242cf307a683e0f4ed507c1ecf9b30d83f0332d899e3a5768c3e81","observation_id":"39603694-50ef-4e27-affb-57c7eb754f85","resolution":{"observed_at":"2026-08-12T18:36:00.104713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.088876Z","title":null,"venue":null,"work_id":"4dde3fd1-1a76-47a2-992e-09d0ab4e6cde","year":2023},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.736993Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:80a039f3218e996a9316b5fe3f54ab293ec1200a634037112e7e4b058a4d9834","observation_id":"0d9da2dd-e1a4-49e1-b420-d93758669cf1","resolution":{"observed_at":"2026-08-12T18:36:00.092837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.740227Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.740227Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:47126d9d2c649a82dff740e0b03c0a766001b77305e2f188610f45daa43d2609","observation_id":"fcd2e4fa-b7db-4bfe-98e2-fe534b1db697","resolution":{"observed_at":"2026-08-12T18:35:59.740227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.743996Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.743996Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:8ddf65014ec69dc007f247ce7e45243af9c049f64ee20cfb849abc2b9306ac48","observation_id":"4666b078-bf88-4c11-bec8-d7bc8cd7ed62","resolution":{"observed_at":"2026-08-12T18:35:59.743996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06300","last_updated":"2017-04-20T18:53:51Z","snapshot_observed_at":"2026-08-15T03:38:56.220511Z","submitted_at":"2017-04-20T18:53:51Z","title":"A Reinforcement Learning Approach to Weaning of Mechanical Ventilation in Intensive Care Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06300","snapshot_observed_at":"2026-08-12T18:35:59.747396Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.747396Z"},"links":{"cited_paper":"/paper/1704.06300","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:939a9a5014fdfe86abedc089b6eb073949078db340113561272e074a46a78034","observation_id":"d470a829-5ff8-4a2f-8206-074ddbd89a5f","resolution":{"observed_at":"2026-08-12T18:35:59.747396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.751444Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.751444Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:fe28bd5bcad594a4270b86df845183f020831c14bafe2c43522a65552d7a24cf","observation_id":"d6724efb-68e3-4366-b7e2-ccf4fcc47c4b","resolution":{"observed_at":"2026-08-12T18:35:59.751444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.755016Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.755016Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:7d568153165e7f84b7a74b72853e3c5ba744d7a121ef19129e6d1b3a9064b519","observation_id":"e0c38d81-767c-44ec-ab96-e3a035356c7f","resolution":{"observed_at":"2026-08-12T18:35:59.755016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.02532","last_updated":"2017-04-08T20:04:03Z","snapshot_observed_at":"2026-08-15T07:36:00.816633Z","submitted_at":"2017-04-08T20:04:03Z","title":"Deep Reinforcement Learning framework for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.02532","snapshot_observed_at":"2026-08-12T18:35:59.758519Z","title":"E., Abdou, M., Perot, E., and Yogamani, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.758519Z"},"links":{"cited_paper":"/paper/1704.02532","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:58c557c2072b0612da30bafde4da528cffa5cc986b7fd485154a411bbe3bf6e1","observation_id":"7fce7cf5-155f-4588-9a64-85b414a3262b","resolution":{"observed_at":"2026-08-12T18:35:59.758519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-17T05:48:50.270608Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-12T18:35:59.762452Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.762452Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:a04d39c2023ee04fa31a3a754f722c21022b5ac0c46c3b67cc9f530558b71a26","observation_id":"32f142d3-c417-4019-bb8a-747a4a27778c","resolution":{"observed_at":"2026-08-12T18:35:59.762452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.038476Z","title":"and Xie, Q","venue":null,"work_id":"4572b87d-23cb-45d3-8503-d8b5c93744ea","year":2018},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.766504Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:27d54fdff5dedfe1be321968d55a58f8546183a7ec305253c6958c1948565f0c","observation_id":"428271ff-1325-4d6a-a264-5acf5a065854","resolution":{"observed_at":"2026-08-12T18:36:00.048189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.771028Z","title":"and Armon, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.771028Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:aa340dcf65eb741d3f08b376def042add52e91f069d460f911dc8830ad1f7130","observation_id":"78b945d5-c1ce-468f-8318-7bd9334bd59b","resolution":{"observed_at":"2026-08-12T18:35:59.771028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:36:00.000663Z","title":"and Wang, L","venue":null,"work_id":"2d608caf-fc38-454c-8882-ed7fb5fec575","year":2024},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.774377Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:7d769f455eff4b8469ebee050d61612dcecbbe95c038afe2d0e75288c18d1980","observation_id":"2b5cb02b-cd30-4de8-b819-8532c5117eba","resolution":{"observed_at":"2026-08-12T18:36:00.006631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-12T18:35:59.778062Z","title":"K., Shyam, P., Mutz, F., Ja \\'s kowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.778062Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:78b04ab5995f236005b432cec3fb7f0a5cd09c4ce13e874326f4fb51429511b4","observation_id":"0ff21285-d901-4b47-901b-4138ce934c81","resolution":{"observed_at":"2026-08-12T18:35:59.778062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.988884Z","title":null,"venue":null,"work_id":"f27d93c8-0813-454c-884a-3382fad43176","year":1995},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.781808Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:14409dd7cc0bbce793287856f7de88a536b986a09febb5d2f61ce27b8d6c4d35","observation_id":"a4c67d7f-c38a-4553-b64b-7f11ccb22ce9","resolution":{"observed_at":"2026-08-12T18:35:59.992730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.977221Z","title":null,"venue":null,"work_id":"fe1f2a21-cb95-4cd3-b896-4c663f0046d8","year":2006},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.785384Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:4d70b1c2334c25303e0ea50f9cebba8e404b9b1a9d47a285c30f637094654ed1","observation_id":"1ce1ff3d-6701-4dc1-8af7-e86ce1fd4fad","resolution":{"observed_at":"2026-08-12T18:35:59.981068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.965077Z","title":null,"venue":null,"work_id":"ece41838-8faf-4be4-8921-da3b3fc9f7bc","year":2002},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.789040Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:e953eeb9cf3a6348bb82b6f353164e196cd5238abd593527a3d55552c3090751","observation_id":"d4032b09-f706-4d38-8406-cbed089e4fba","resolution":{"observed_at":"2026-08-12T18:35:59.968977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.954068Z","title":null,"venue":null,"work_id":"55e79577-cd12-414d-9b98-d3e70e6e46af","year":2021},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.792631Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:2e8b615a40708023d564cfc67c69f5d8b9714eb72832d11d971ad4e77e65310d","observation_id":"5818cd91-1ac4-4f32-9642-6f5116d0e862","resolution":{"observed_at":"2026-08-12T18:35:59.957638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:35:59.942278Z","title":"R., and Zeng, D","venue":null,"work_id":"a2d07167-327a-4fbc-80ee-cb92bca90938","year":2009},"citing_paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T18:35:59.796489Z"},"links":{"citing_paper":"/paper/2411.11457"},"observation_digest":"sha256:dc95f7e2d36c05fd6176aba03c06c0f1b68631446eb94db0f31aabcdf2fa2889","observation_id":"684369a4-35c1-47a2-8e24-5e7eecc5e9eb","resolution":{"observed_at":"2026-08-12T18:35:59.946338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11457","last_updated":"2024-11-18T10:44:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T09:25:13.586799Z","submitted_at":"2024-11-18T10:44:20Z","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2411.11457."}