{"as_of":"2026-08-13T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ed89e9375e4adcd8378906ce6152561ee61273e4a7db765919375c2cdd6ac6b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:13:10.092408Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.02774/citation-record","integrity":"/paper/2501.02774/integrity","json":"/paper/2501.02774/citation-record.json","paper":"/paper/2501.02774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:07.874981Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:07.874981Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:fd65e206baf718d30780274dd5227934a07653b6c0f68661ca1e2e213bcc9dad","observation_id":"f3ce5166-102e-49cb-b77e-86b7d2e3b02e","resolution":{"observed_at":"2026-08-10T22:13:07.874981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-10T22:13:07.931810Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:07.931810Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:b0d21e494c7a9705ab1eb422e3eda6bd4c5929b49fab4b86fc8cd527c4613e15","observation_id":"16c667f4-1af0-449b-9d6a-6317cbd823f6","resolution":{"observed_at":"2026-08-10T22:13:07.931810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-10T22:13:07.973484Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:07.973484Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:8a679e81969b481b2b18fa073f9c5efe2db13dfd62c7d9df387636649fb0ef78","observation_id":"85a6db6c-117f-423a-9601-4f742d222a3a","resolution":{"observed_at":"2026-08-10T22:13:07.973484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.02532","last_updated":"2017-04-08T20:04:03Z","snapshot_observed_at":"2026-07-06T05:37:05.504755Z","submitted_at":"2017-04-08T20:04:03Z","title":"Deep Reinforcement Learning framework for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.02532","snapshot_observed_at":"2026-08-10T22:13:08.021368Z","title":"Deep rein- forcement learning framework for autonomous driving,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.021368Z"},"links":{"cited_paper":"/paper/1704.02532","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:f28d9966e5e8bfa6110707db6ab417270864018667a1e2ad5acea76dcebd9dc5","observation_id":"ebf5726b-06b7-42e8-8f35-4871cf29760a","resolution":{"observed_at":"2026-08-10T22:13:08.021368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:15.090732Z","title":"Continuous mdp homomorphisms and homomorphic policy gradient,","venue":null,"work_id":"9036f975-ba22-4c95-b586-de27356b0c2a","year":2022},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.064753Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:4ce100ef1bdd6cfa5614d8af7dd909f7496b76aa6a73d177eb53baa28bf22312","observation_id":"bc5a620d-d7d0-4110-9afc-d63e310814f9","resolution":{"observed_at":"2026-08-10T22:13:15.124756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-10T22:13:08.115774Z","title":"Td-mpc2: Scalable, robust world models for continuous control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.115774Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:d891044e93b26f35f75303b419dade8d85335e6c9d18a5cc9ee381db26074e39","observation_id":"48462379-f791-4650-bc6b-fe83478d06c5","resolution":{"observed_at":"2026-08-10T22:13:08.115774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.975668Z","title":"Movie: Visual model-based policy adaptation for view generalization,","venue":null,"work_id":"41f497b5-a810-4e5a-8ad2-02d7dec2a103","year":2024},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.145799Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:94281365f8ce785f162bca7c315defa7a352b72d5ca802246ae2939f9aad7f53","observation_id":"773dc85a-275e-4afa-a622-a962d8bcf345","resolution":{"observed_at":"2026-08-10T22:13:15.014268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.930063Z","title":"Making better decision by directly planning in continuous control,","venue":null,"work_id":"76dea501-8543-4236-b1e8-6f5d4e7e575c","year":2021},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.194612Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:459ac178e3bdc08aa885237e211e70fe9a2e70e39da51a59f24cc2d99ba6c6f4","observation_id":"c90270ed-d52e-4f73-a5af-0d61e1f651db","resolution":{"observed_at":"2026-08-10T22:13:14.943242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.837684Z","title":"Hierarchical advantage for reinforcement learning in parameterized action space,","venue":null,"work_id":"1bfb6c97-105c-413d-8b9d-6541cdac864f","year":2021},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.244753Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:db81a2d023d864eee75d6879fa632fad28eac34813af1c16ae6684f5928d14ce","observation_id":"efd40ed2-e94b-4ee3-8e81-250cc28bf14c","resolution":{"observed_at":"2026-08-10T22:13:14.885947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04143","last_updated":"2024-05-03T15:00:50Z","snapshot_observed_at":"2026-08-06T01:36:48.822991Z","submitted_at":"2015-11-13T02:34:33Z","title":"Deep Reinforcement Learning in Parameterized Action Space","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04143","snapshot_observed_at":"2026-08-10T22:13:08.294832Z","title":"Deep reinforcement learning in parame- terized action space,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.294832Z"},"links":{"cited_paper":"/paper/1511.04143","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:b0b6a25b7cfef71aec26d42e3f91fdb306b9e606c228b6a3379c23831837b4e4","observation_id":"dc94fb86-bcb7-49ae-af24-eb4ae35ee822","resolution":{"observed_at":"2026-08-10T22:13:08.294832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.04959","last_updated":"2019-03-12T14:40:32Z","snapshot_observed_at":"2026-08-08T10:43:14.532317Z","submitted_at":"2019-03-12T14:40:32Z","title":"Deep Multi-Agent Reinforcement Learning with Discrete-Continuous Hybrid Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.04959","snapshot_observed_at":"2026-08-10T22:13:08.344754Z","title":"Deep multi-agent reinforcement learning with discrete-continuous hybrid action spaces,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.344754Z"},"links":{"cited_paper":"/paper/1903.04959","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:8d7cff9268ae572859b384d9588bad049011c4aaeb6e3b023354b2963bf2b648","observation_id":"58fbc369-6f81-4cd0-ac1f-861e330543f7","resolution":{"observed_at":"2026-08-10T22:13:08.344754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06394","last_updated":"2018-10-10T07:38:44Z","snapshot_observed_at":"2026-08-09T23:24:18.245888Z","submitted_at":"2018-10-10T07:38:44Z","title":"Parametrized Deep Q-Networks Learning: Reinforcement Learning with Discrete-Continuous Hybrid Action Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06394","snapshot_observed_at":"2026-08-10T22:13:08.394751Z","title":"Parametrized deep q-networks learning: Reinforcement learning with discrete-continuous hybrid action space,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.394751Z"},"links":{"cited_paper":"/paper/1810.06394","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:fbe2ce3206fc61d3a33cfd37ddc2b94f0c4f76497b6a1527d9c7a2d03bf5340d","observation_id":"4e967c4e-ef86-4707-83df-62f7a5cb5816","resolution":{"observed_at":"2026-08-10T22:13:08.394751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.01344","last_updated":"2019-05-30T13:02:58Z","snapshot_observed_at":"2026-08-06T22:12:13.879900Z","submitted_at":"2019-03-04T16:33:15Z","title":"Hybrid Actor-Critic Reinforcement Learning in Parameterized Action Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.01344","snapshot_observed_at":"2026-08-10T22:13:08.430878Z","title":"Hybrid actor-critic rein- forcement learning in parameterized action space,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.430878Z"},"links":{"cited_paper":"/paper/1903.01344","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:93f77b8cde1e6b53ad9ef3d0216cf76637dedd654ce86cf2dab151ec03eb2e69","observation_id":"214518cb-6f71-4875-bb3e-b8c8c8a3b67a","resolution":{"observed_at":"2026-08-10T22:13:08.430878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05490","last_updated":"2022-03-16T08:15:15Z","snapshot_observed_at":"2026-08-09T15:52:09.585327Z","submitted_at":"2021-09-12T11:26:27Z","title":"HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05490","snapshot_observed_at":"2026-08-10T22:13:08.471598Z","title":"Hyar: Addressing discrete-continuous action reinforcement learning via hybrid action representation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.471598Z"},"links":{"cited_paper":"/paper/2109.05490","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:9d993e1b98fa2ca56712b2dc13dcd965a1d231f3f573eb43c7ae87134cb12b23","observation_id":"a1030316-f089-4206-8969-67613adac404","resolution":{"observed_at":"2026-08-10T22:13:08.471598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.754753Z","title":"Reinforcement learning with parameterized actions,","venue":null,"work_id":"21bc52e8-9097-41c8-a214-cce029ec6111","year":1934},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.520651Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:1a9bd04ea5628d71a5eea88c7f6eb9a8cc56a6d2c1894a4dd29758dabeaf0d59","observation_id":"023c83db-31dc-44f9-adae-bef1638bc15b","resolution":{"observed_at":"2026-08-10T22:13:14.792724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-10T22:13:08.565456Z","title":"Dream to control: Learn- ing behaviors by latent imagination,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.565456Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:d592dcab61c0c2ea58a49c09620b5d1757e6cc87511343490dd30cdfff2771bb","observation_id":"35cbf09d-f9b8-4de6-8456-c4e8ee3bdedf","resolution":{"observed_at":"2026-08-10T22:13:08.565456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-10T22:13:08.612810Z","title":"Mastering atari with discrete world models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.612810Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:9ae0e440585872eb7e9d7539e3843d98b11140cad2b6a788857df630b3fa625f","observation_id":"1f76ae8c-4ccf-4d0f-bd9a-2335b5b9b408","resolution":{"observed_at":"2026-08-10T22:13:08.612810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14853","last_updated":"2024-05-23T17:57:14Z","snapshot_observed_at":"2026-08-12T23:59:31.191878Z","submitted_at":"2024-05-23T17:57:14Z","title":"Privileged Sensing Scaffolds Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2405.14853","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14853","snapshot_observed_at":"2026-08-10T22:13:11.698337Z","title":"Privileged Sensing Scaffolds Reinforcement Learning","venue":"cs.LG","work_id":"0252e1e6-d2bd-402a-b5bd-2c4f3c2f5d09","year":2024},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.653657Z"},"links":{"cited_paper":"/paper/2405.14853","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:e820a062086821bc50355857f7f74a6c5101f72c7e95e478143a7077fba900d9","observation_id":"fb9e0995-93ab-4e25-bbb2-dc5d3442620a","resolution":{"observed_at":"2026-08-10T22:13:11.734749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03037","last_updated":"2024-05-24T02:15:42Z","snapshot_observed_at":"2026-08-13T00:38:10.642926Z","submitted_at":"2024-04-03T19:48:13Z","title":"Model-based Reinforcement Learning for Parameterized Action Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03037","snapshot_observed_at":"2026-08-10T22:13:08.703941Z","title":"Model-based rein- forcement learning for parameterized action spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.703941Z"},"links":{"cited_paper":"/paper/2404.03037","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:e45932dd42e6c348b4ea5e82dd37ca7f58896c00cb6f10ba8c21686d1655d856","observation_id":"34d92f07-a7cd-49b7-9bb0-2ca85dc350f9","resolution":{"observed_at":"2026-08-10T22:13:08.703941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02222","last_updated":"2023-07-10T16:07:17Z","snapshot_observed_at":"2026-07-06T14:14:18.434647Z","submitted_at":"2022-11-04T02:10:35Z","title":"The Benefits of Model-Based Generalization in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.02222","snapshot_observed_at":"2026-08-10T22:13:08.734656Z","title":"The benefits of model-based generalization in reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.734656Z"},"links":{"cited_paper":"/paper/2211.02222","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:d803e7c57d6c31b94a0ea0b2c75604a4b181eb06a343ee507692a6f89fd7238e","observation_id":"4ef3cd29-9f52-46e3-9eaa-a75d1a33c9a7","resolution":{"observed_at":"2026-08-10T22:13:08.734656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.571332Z","title":"Diminishing return of value expansion methods in model-based reinforcement learning,","venue":null,"work_id":"9af602ba-37a0-4975-b5b4-63d3f573bb7b","year":2023},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.749078Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:d451fa1c43e9f4456730a561e5ee9f7a66c99738e23045ef93ef1066a33b3c8d","observation_id":"a393001f-e5fd-4011-9e24-a7db96cc6e9f","resolution":{"observed_at":"2026-08-10T22:13:14.614751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.04603","last_updated":"2020-12-08T18:03:21Z","snapshot_observed_at":"2026-08-10T05:37:49.315156Z","submitted_at":"2020-12-08T18:03:21Z","title":"Models, Pixels, and Rewards: Evaluating Design Trade-offs in Visual Model-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2012.04603","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.04603","snapshot_observed_at":"2026-08-10T22:13:11.418139Z","title":"Models, Pixels, and Rewards: Evaluating Design Trade-offs in Visual Model-Based Reinforcement Learning","venue":"cs.LG","work_id":"ec7beb45-044e-4d97-9175-33d77bbd91f7","year":2020},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.787783Z"},"links":{"cited_paper":"/paper/2012.04603","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:b659dbc933230dd3efdbb05fee3d211d3cb23f25dae187026b3a9f5a46d1fd0e","observation_id":"43c3c435-2a7c-4e9e-a36b-c1bef140e093","resolution":{"observed_at":"2026-08-10T22:13:11.443147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01450","last_updated":"2024-02-18T00:59:14Z","snapshot_observed_at":"2026-08-13T05:33:57.393328Z","submitted_at":"2023-11-02T17:57:38Z","title":"DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing","version":2},"cited_work":{"arxiv_id":"2311.01450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01450","snapshot_observed_at":"2026-08-10T22:13:11.371177Z","title":"DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing","venue":"cs.LG","work_id":"5d6173a3-bb9d-4771-b21c-b9fd65cffb3a","year":2023},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.824907Z"},"links":{"cited_paper":"/paper/2311.01450","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:971b802a199637518e8620668a2f2d7bbfc153cfa6a2e4f118fcb915fd8db060","observation_id":"55f67307-798f-4012-bfd5-64cbd6767d41","resolution":{"observed_at":"2026-08-10T22:13:11.388643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04388","last_updated":"2019-05-10T21:57:41Z","snapshot_observed_at":"2026-08-12T10:23:58.123555Z","submitted_at":"2019-05-10T21:57:41Z","title":"Multi-Pass Q-Networks for Deep Reinforcement Learning with Parameterised Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.04388","snapshot_observed_at":"2026-08-10T22:13:08.859571Z","title":"Multi-pass q-networks for deep reinforcement learning with parameterised action spaces,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.859571Z"},"links":{"cited_paper":"/paper/1905.04388","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:ad01eed0f4e63012139b696a335c37dbbfc2a788308ef49c32188ed533d544ef","observation_id":"57fc4af9-3968-4d15-aff1-64006f9c2c8b","resolution":{"observed_at":"2026-08-10T22:13:08.859571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.433742Z","title":"Learning insertion primitives with discrete-continuous hybrid action space for robotic assembly tasks,","venue":null,"work_id":"8c6009a2-a68b-4e74-8531-ab6b960cf335","year":2022},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.881404Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:a968d68be6155be7e9f475c1b4af8311c6c933afc028f96e69348fe9a3e80ee1","observation_id":"61a66bf1-3717-430b-b6d1-4807988fa085","resolution":{"observed_at":"2026-08-10T22:13:14.485857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.313186Z","title":"Lipschitz continuity in model- based reinforcement learning,","venue":null,"work_id":"4ba576bc-b8d7-4b0c-81c4-ab65bd9ed6d3","year":2018},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.897601Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:e93aa5b0b4e6e75b8008286d55a89aec163f7113f8e016a6fc0f088b85f3c4c3","observation_id":"99753433-1d7b-4a4f-955a-f554b0454e9b","resolution":{"observed_at":"2026-08-10T22:13:14.334749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.253138Z","title":"Markov processes over denumerable products of spaces, describing large systems of automata,","venue":null,"work_id":"92a9ba99-aa3f-41b4-bf66-aeadd7424fe5","year":1969},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.924857Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:4cbbfc5621d998ae9c86c5ff222c7f181bc63f1cc17cabf6b7cb4de199757eda","observation_id":"0e95acb9-b3ea-4e4b-b779-c6c713777e18","resolution":{"observed_at":"2026-08-10T22:13:14.268779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-12T17:13:46.394331Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-10T22:13:08.974756Z","title":"Explaining and harnessing adversarial examples,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:08.974756Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:b9bfcf90f5000e25ba270d44681965de6958a5ee59698e940e7f33fbc69171d3","observation_id":"055f35d8-f7a8-4de8-9abc-70969ac87f0d","resolution":{"observed_at":"2026-08-10T22:13:08.974756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:09.014851Z","title":"A mathematical theory of communication,","venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.014851Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:b5d05742ff45f3b38cf65c27b1a859fe452ef632d8e2ce688c7bf838c1a3912f","observation_id":"c5e37482-ebdb-46f1-afea-f32b426a8185","resolution":{"observed_at":"2026-08-10T22:13:09.014851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.198448Z","title":"The im algorithm: a variational approach to information maximization,","venue":null,"work_id":"4eefe29b-6848-4980-b51b-2c17c3a618f7","year":2004},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.063516Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:2f2683734a817b8307c60b0c7216466d0643ba72166d1fe01d62e5e5ff9228b1","observation_id":"8aa9f94b-ea28-4d56-957a-ae76c286218d","resolution":{"observed_at":"2026-08-10T22:13:14.209556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.113467Z","title":"Learning-based model predictive control for markov decision processes,","venue":null,"work_id":"6a05a7b1-d46b-482e-8c67-ce71559a9a00","year":2005},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.092320Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:05c05e27696df626676a04077260303c3b4ea7ed3045e81316828255027e39da","observation_id":"4c1b5286-a103-4fe4-ac63-cfef51d5a6bb","resolution":{"observed_at":"2026-08-10T22:13:14.155133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:14.035071Z","title":"Optimization of computer simulation models with rare events,","venue":null,"work_id":"7e4112d6-4367-4351-a259-fd0aaa434591","year":1997},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.122904Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:0ec7a0e2199f0b2621a8f101b3fb3bafc1197a029b4d4fe997ed34c34a3ba99d","observation_id":"55fd597e-cee8-4b0d-92d6-e2bed94a51f7","resolution":{"observed_at":"2026-08-10T22:13:14.058320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.893525Z","title":"Plan to predict: Learning an uncertainty-foreseeing model for model-based reinforce- ment learning,","venue":null,"work_id":"16a91a25-29ca-4510-9972-57c980f9cb63","year":2022},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.152757Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:3f5b312df66c0b9b8f2abd0747f2b3009861c501076d329703deb6493693c833","observation_id":"bbf4ba56-0ff9-4a24-9d8a-20309191a49d","resolution":{"observed_at":"2026-08-10T22:13:13.934751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13350","last_updated":"2024-01-19T17:33:36Z","snapshot_observed_at":"2026-08-04T07:48:29.837484Z","submitted_at":"2022-11-23T23:31:14Z","title":"Choreographer: Learning and Adapting Skills in Imagination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13350","snapshot_observed_at":"2026-08-10T22:13:09.179782Z","title":"Choreographer: Learning and adapting skills in imagination,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.179782Z"},"links":{"cited_paper":"/paper/2211.13350","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:81b579704754a9b0091059bfcaf7b92b160b26b70d668d780ae73c7e7f858996","observation_id":"2ba40424-c73c-4155-b3b7-e6a2ca0c21d5","resolution":{"observed_at":"2026-08-10T22:13:09.179782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.746511Z","title":"Mismatched no more: Joint model-policy optimization for model- based rl,","venue":null,"work_id":"801a1f23-c6e6-4f99-bac2-c8fc90e49f81","year":2022},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.224823Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:f8d68984f76b3323beb245b1e8b1a25245132c9266c6b7ad1b2a40b197a10d25","observation_id":"df786e93-e2c2-480a-97e1-3820ec7f11a7","resolution":{"observed_at":"2026-08-10T22:13:13.784917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.691992Z","title":"Differen- tiable mpc for end-to-end planning and control,","venue":null,"work_id":"7d9d070e-6e1c-4f19-bdb4-a54c7b7aecf7","year":2018},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.284743Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:1bb5d170886410151c05a6bcaa971b1cdc0ee7f3cd422806fd1f12f0e9683012","observation_id":"c677bc8f-2160-41dc-b0dd-0eb365f470d0","resolution":{"observed_at":"2026-08-10T22:13:13.705206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:09.329785Z","title":"On information and sufficiency,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.329785Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:c9027e439f584aad764c12cc74ca3ce3cb4ac849fbe772f4a6fbbf43e2d7edca","observation_id":"70895f64-e819-42f1-b1ac-c051685bf061","resolution":{"observed_at":"2026-08-10T22:13:09.329785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.565534Z","title":"Measures of distance between probability distributions,","venue":null,"work_id":"e63a9873-eba8-47d5-b38e-dbb76a6b204f","year":1989},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.374768Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:3cbfb0f5a7ec55c87da2aeab329f8c757e1b1e3a8ea7ec87f7f8278badd47567","observation_id":"e934efb5-2c2d-432e-a0a3-ba4114c01bd4","resolution":{"observed_at":"2026-08-10T22:13:13.588551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18866","last_updated":"2024-06-04T09:26:15Z","snapshot_observed_at":"2026-08-13T04:07:40.833384Z","submitted_at":"2024-02-29T05:34:05Z","title":"Dr. Strategy: Model-Based Generalist Agents with Strategic Dreaming","version":2},"cited_work":{"arxiv_id":"2402.18866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18866","snapshot_observed_at":"2026-08-10T22:13:11.119769Z","title":"Dr. Strategy: Model-Based Generalist Agents with Strategic Dreaming","venue":"cs.LG","work_id":"03beef65-1271-424c-97fc-72f5a324d56b","year":2024},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.424745Z"},"links":{"cited_paper":"/paper/2402.18866","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:6f478096e8bcf34ff8556717a31f525504496c4d91292fafeba550f1dd2e74a5","observation_id":"3a1cab5a-896b-4d5f-ba88-fbc9d853d983","resolution":{"observed_at":"2026-08-10T22:13:11.155546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.483203Z","title":"When to trust your model: Model-based policy optimization,","venue":null,"work_id":"926d6c6b-c884-423b-9c61-2e783963eb2e","year":2019},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.486673Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:a43f4f5ab7ffaee24a3d0d1859b18078281441c31c2c70b8d9f21e14f5dbfc84","observation_id":"ce6fd07d-e6c5-4bb2-a43a-1b59251b0e2e","resolution":{"observed_at":"2026-08-10T22:13:13.507143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.391342Z","title":"Model-based reinforcement learning via meta-policy optimization,","venue":null,"work_id":"85f14cc0-38b9-4371-a622-535582de72c8","year":2018},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.505310Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:d753852218016cf83701a8036fd7c0054b158dfc47732b53860823a3448028b6","observation_id":"e6b81818-ff75-43bf-b7aa-7adf24c03920","resolution":{"observed_at":"2026-08-10T22:13:13.411043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.263820Z","title":"The virtues of laziness in model-based rl: A unified objective and algo- rithms,","venue":null,"work_id":"5e0600e1-a3d6-4dad-a950-28c6cc85e6e0","year":2023},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.538880Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:008993eb58b16b73de841c603fd32a0c541bd0cc6cc1008642b2dc09ae48417f","observation_id":"24d689a0-cebb-460a-ba81-f0f1b7f8df2c","resolution":{"observed_at":"2026-08-10T22:13:13.304750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.149753Z","title":"Iterative value-aware model learning,","venue":null,"work_id":"f2ea55c5-6c48-4bbd-b3cb-1ac9820f781d","year":2018},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.563874Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:59d668055e21467a61f62a2f08120b69b5ab10650ca43dc36b7dceaed05cc556","observation_id":"c3bcd5d5-fc70-48c4-ab46-475e1479b127","resolution":{"observed_at":"2026-08-10T22:13:13.193218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:13.092720Z","title":"Model-based value expansion for efficient model-free rein- forcement learning,","venue":null,"work_id":"f0e63abf-c9c8-49ec-a799-78a36ab2d767","year":2018},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.571543Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:02956e5edb10e7680ec0ad599fc156ac2ee485ec0cc49ca7f9b3741b55a8a6a9","observation_id":"7eb6f6a4-bf98-48ea-8459-17304275825f","resolution":{"observed_at":"2026-08-10T22:13:13.100233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:12.991714Z","title":"Villani et al","venue":null,"work_id":"20733548-f7e9-4b11-8bae-adf4148eca28","year":2009},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.583592Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:c025619f774a3cd2b4efc2211a8e65d9a12a9c6032a09d9d96c697e64cf3f493","observation_id":"7d7bce9d-9972-4c4f-8e45-2228a24eb222","resolution":{"observed_at":"2026-08-10T22:13:13.025685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:09.607965Z","title":"Generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.607965Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:816183817536386d26a9f50299764471f8bd34d12d90ddeddd457656e3d74693","observation_id":"6a423560-c737-4b7b-9eb0-ba5fc99a2d78","resolution":{"observed_at":"2026-08-10T22:13:09.607965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.04862","last_updated":"2017-01-17T20:46:21Z","snapshot_observed_at":"2026-08-12T20:41:02.388462Z","submitted_at":"2017-01-17T20:46:21Z","title":"Towards Principled Methods for Training Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.04862","snapshot_observed_at":"2026-08-10T22:13:09.634751Z","title":"Towards principled methods for train- ing generative adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.634751Z"},"links":{"cited_paper":"/paper/1701.04862","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:ffb092894003fa8de4cf1536104ac3c9006fa873cd6a74cc9a696b1f492e7869","observation_id":"21fad6e0-ba0c-4e0c-94a5-bf23d2e010f7","resolution":{"observed_at":"2026-08-10T22:13:09.634751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:12.774755Z","title":"Wasserstein generative ad- versarial networks,","venue":null,"work_id":"d0a547f0-db00-4c45-a65e-c92ea5c2a8a6","year":2017},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.684749Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:9f91796bb77ff30cd6b845b6b083dc3052553ebba63d2c1d1b39761b2c9e0939","observation_id":"1629a347-0aa7-448f-853a-47d4f3ec0bae","resolution":{"observed_at":"2026-08-10T22:13:12.814759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:12.672409Z","title":"Harpy, a connected speech recognition system,","venue":null,"work_id":"80ffce18-d257-4fcf-8642-b404665ef039","year":1976},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.734752Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:20c8de5b47a1789faf276e518c4c670877a6c5d364212eed30380520e777e20a","observation_id":"2a9e0545-bac5-4c2e-9959-ff8fe7f60c67","resolution":{"observed_at":"2026-08-10T22:13:12.704852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-10T22:13:09.784750Z","title":"Google’s neural machine translation system: Bridging the gap between human and machine translation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.784750Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:d23e112a42b79163853e6724b49a65b280c55328b7bdf0d1e435ab77f6ff70d4","observation_id":"44c6830e-c21a-4e80-bd0a-d0cdc6c7c663","resolution":{"observed_at":"2026-08-10T22:13:09.784750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01880","last_updated":"2024-12-18T18:31:42Z","snapshot_observed_at":"2026-08-12T23:09:04.365677Z","submitted_at":"2024-08-03T23:15:57Z","title":"Walk Wisely on Graph: Knowledge Graph Reasoning with Dual Agents via Efficient Guidance-Exploration","version":4},"cited_work":{"arxiv_id":"2408.01880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01880","snapshot_observed_at":"2026-08-10T22:13:10.850809Z","title":"Walk Wisely on Graph: Knowledge Graph Reasoning with Dual Agents via Efficient Guidance-Exploration","venue":"cs.AI","work_id":"40a959f8-3f17-4953-984a-0b3f56632eba","year":2024},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.822192Z"},"links":{"cited_paper":"/paper/2408.01880","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:8747a9c9dcef7fd39583d6e8134119c63ca723a0a605727b0ad37f88b5489690","observation_id":"f74544f5-fdee-48fc-bab3-6d7f128b19fd","resolution":{"observed_at":"2026-08-10T22:13:10.883459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10941","last_updated":"2017-05-31T04:56:25Z","snapshot_observed_at":"2026-08-05T12:22:57.956907Z","submitted_at":"2017-05-31T04:56:25Z","title":"Spectral Norm Regularization for Improving the Generalizability of Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10941","snapshot_observed_at":"2026-08-10T22:13:09.864761Z","title":"Spectral norm regularization for improving the generalizability of deep learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.864761Z"},"links":{"cited_paper":"/paper/1705.10941","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:854267a4a51abc28982c8c887d390864e63fa2590c8f8eaa357ad9033c12ee27","observation_id":"4ae52c77-d93e-43f9-b08d-39c637e62b6b","resolution":{"observed_at":"2026-08-10T22:13:09.864761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-10T22:13:09.893528Z","title":"Categorical reparameterization with gumbel-softmax,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.893528Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:60d4db096a177ab6a3b508a9ba7888181e33e997698e421261fc8a998dc1db86","observation_id":"a214a2d9-fd2c-4359-be98-2a65c8aed1b3","resolution":{"observed_at":"2026-08-10T22:13:09.893528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:12.579224Z","title":"Introduction to online convex optimization,","venue":null,"work_id":"7b8c8e0e-eb3b-49f8-a2c7-8812689d7f33","year":2016},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.921439Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:60c83aa09bafabd9d131da90d8a2e663036926b3e0f6dfb849afa70520b283f6","observation_id":"5a172a2a-29bd-4124-916a-e77d37a0d58b","resolution":{"observed_at":"2026-08-10T22:13:12.603409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01244","last_updated":"2023-02-02T17:27:16Z","snapshot_observed_at":"2026-08-11T02:00:13.590368Z","submitted_at":"2023-02-02T17:27:16Z","title":"Is Model Ensemble Necessary? Model-based RL via a Single Model with Lipschitz Regularized Value Function","version":1},"cited_work":{"arxiv_id":"2302.01244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.01244","snapshot_observed_at":"2026-08-10T22:13:10.294045Z","title":"Is Model Ensemble Necessary? Model-based RL via a Single Model with Lipschitz Regularized Value Function","venue":"cs.LG","work_id":"6034f939-1d43-405d-861e-9c7575175d6a","year":2023},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.964752Z"},"links":{"cited_paper":"/paper/2302.01244","citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:a97bb0d4d65322219f50df92c39f27e92b0b6c3daace0542409aff074ffea557","observation_id":"6d0d3d94-3f37-47e5-841f-80391b92d272","resolution":{"observed_at":"2026-08-10T22:13:10.344751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:09.994817Z","title":"Visualizing data using t-sne.,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:09.994817Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:56ddc9b4c7515fafd931da79a4bc9e1b3cddea5af65b88dd83901f543c3c1993","observation_id":"dd4be036-c677-46ec-81b8-6c3558dcd1b7","resolution":{"observed_at":"2026-08-10T22:13:09.994817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:12.500852Z","title":"General boundary conditions for denumberable markov processes,","venue":null,"work_id":"58421333-b0f1-4eaf-8ef4-d9b82c55ff0c","year":1967},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:10.044751Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:54090ce149e7e9f9428fd16dc5d37452954d9250f1ad06c433f91ab13bccdf31","observation_id":"10f6f2d4-73a8-4e7e-8c07-df67b7a7e86f","resolution":{"observed_at":"2026-08-10T22:13:12.519612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:12.449570Z","title":null,"venue":null,"work_id":"2e354bef-447c-4641-8eef-40008126829a","year":2014},"citing_paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:10.092408Z"},"links":{"citing_paper":"/paper/2501.02774"},"observation_digest":"sha256:99cf38264cbe0e8239368d1f57556d43befc69f74feccc69e998c965b8bfd224","observation_id":"51b87c37-82ee-431a-aae4-056eb7bf6398","resolution":{"observed_at":"2026-08-10T22:13:12.478583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.02774","last_updated":"2025-01-06T05:33:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T01:56:49.335230Z","submitted_at":"2025-01-06T05:33:09Z","title":"Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":6,"verified_fuzzy":26},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2501.02774."}