{"as_of":"2026-08-08T15:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd490b413e6521e323d01aaa642af972429024e43f3e699c2897d30b17c87a6a","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:37:43.138992Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T09:24:21.047027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.01432","doi":"10.48550/arxiv.2509.01432","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL http://arxiv.org/ abs/2509.01432","venue":"ArXiv.org","work_id":"eb7b9792-c345-4c28-beaa-94b676d9f03d","year":null},"citing_paper":{"arxiv_id":"2606.29092","last_updated":"2026-06-27T21:20:26Z","snapshot_observed_at":"2026-07-07T00:03:07.870153Z","submitted_at":"2026-06-27T21:20:26Z","title":"Priced Motion Through Optimal Faces: A Normal-Fan Geometry for Non-Stationary Adversarial MDPs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:21.047027Z"},"links":{"cited_paper":"/paper/2509.01432","citing_paper":"/paper/2606.29092"},"observation_digest":"sha256:e954d0afe090dc06d28e744fcff8bea72beb927741b5ca010297c952d8fd0f28","observation_id":"ca580af9-5ac7-4c3c-93c9-5f55179017f4","resolution":{"observed_at":"2026-06-30T09:24:31.577549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01432/citation-record","integrity":"/paper/2509.01432/integrity","json":"/paper/2509.01432/citation-record.json","paper":"/paper/2509.01432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-05T12:37:41.058718Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.058718Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:49eeb044f3da7fa8bb8c0bbb577bb0fdb14fb77d35e729d6b8fbb5ec1824342b","observation_id":"7017f336-dd9e-45ff-8230-88b646aeb530","resolution":{"observed_at":"2026-08-05T12:37:41.058718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.038587Z","title":null,"venue":null,"work_id":"0a409fb3-d4a6-4852-b55c-80093f5dd6b0","year":2016},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.672881Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:029bde80e657802eb659993a5d919e2f5d9f8ee0394dad175adefcd33b7ff209","observation_id":"4a833dc7-94fc-4146-b840-4d5c48f00440","resolution":{"observed_at":"2026-08-05T12:37:45.041818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02957","last_updated":"2025-08-15T12:29:02Z","snapshot_observed_at":"2026-08-08T11:31:58.146859Z","submitted_at":"2024-11-05T09:55:50Z","title":"Embedding Safety into RL: A New Take on Trust Region Methods","version":4},"cited_work":{"arxiv_id":"2411.02957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02957","snapshot_observed_at":"2026-08-05T12:37:43.755872Z","title":"Embedding Safety into RL: A New Take on Trust Region Methods","venue":"cs.LG","work_id":"049fee18-9a90-4dcf-a66f-ebb1876f1283","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.538793Z"},"links":{"cited_paper":"/paper/2411.02957","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:572d764d6bbf931a39f004b169e2155d01741e71efcd29b3071c6326c8089367","observation_id":"00258e82-80e4-45ea-8e95-57830cc71bbb","resolution":{"observed_at":"2026-08-05T12:37:43.877379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-08T08:46:12.458129Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00700","snapshot_observed_at":"2026-08-05T12:37:41.630698Z","title":"Central path proximal policy optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.630698Z"},"links":{"cited_paper":"/paper/2506.00700","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:3af209bb28edcd755f6233e9b52b62a2d763edbb95b573d3af04687e8cc5dced","observation_id":"7a1ef6a6-4859-4cd6-84de-2a19d6439ba4","resolution":{"observed_at":"2026-08-05T12:37:41.630698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01511","last_updated":"2023-01-27T11:13:06Z","snapshot_observed_at":"2026-08-06T14:26:15.888162Z","submitted_at":"2022-02-03T10:47:10Z","title":"Challenging Common Assumptions in Convex Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2202.01511","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.01511","snapshot_observed_at":"2026-08-05T12:37:43.437887Z","title":"Challenging Common Assumptions in Convex Reinforcement Learning","venue":"cs.LG","work_id":"62d3e6fd-3e28-4dee-af70-3a6f3c09e685","year":2022},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.781429Z"},"links":{"cited_paper":"/paper/2202.01511","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:aa5a546a14b624e7a54e973884eb2e20d571a921f7dc01361afed55da8abe838","observation_id":"da82822d-3ba2-44a5-917e-2123bfae2ef0","resolution":{"observed_at":"2026-08-05T12:37:43.566193Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T12:37:41.925676Z","title":"Martin L Puterman.Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.925676Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:f9e119aef236a10f42925b9d74a17592594fcf79a48c80843e2e6375e9790e5d","observation_id":"9b485471-8f66-456a-bb8a-ff4990223dc6","resolution":{"observed_at":"2026-08-05T12:37:41.925676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.047807Z","title":"∇θ log π(a′|s′) X s,a Mπ(s, a|s′, a′)rπ(s, a) # (30) = (1 − γ)Es′,a′∼ω","venue":null,"work_id":"bbca9dec-32e6-4dfa-9540-8ac93f585937","year":2020},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.618804Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:2f5d13c42c322786ea4479b72126e473d29b2e17cdfe5e364640de0b91801ee2","observation_id":"cd88364a-c138-46fb-9d54-6033d95ee3aa","resolution":{"observed_at":"2026-08-05T12:37:45.051249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.088094Z","title":"Mirror descent policy optimization","venue":null,"work_id":"6d800c91-95fc-4ec2-aaec-66e9c887dbed","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.255450Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:2af8be80201006c7285e13d3eff0f20c0817e9a2cf4bf46d57ec7bee911c2638","observation_id":"aeb9da49-ed6c-420a-af72-5dde93a64e1d","resolution":{"observed_at":"2026-08-05T12:37:45.091767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11066","last_updated":"2023-01-10T19:21:06Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T02:21:34Z","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11066","snapshot_observed_at":"2026-08-05T12:37:42.367138Z","title":"Junyu Zhang, Alec Koppel, Amrit Singh Bedi, Csaba Szepesvari, and Mengdi Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.367138Z"},"links":{"cited_paper":"/paper/2105.11066","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:6a2d40db48da42ee9dc57c1fc1f605cef50d62bd1c6b45765116f044ffc86526","observation_id":"0b3b05ba-0956-46ea-af58-317195781842","resolution":{"observed_at":"2026-08-05T12:37:42.367138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.058406Z","title":"Interestingly, it also appears in the differential of the map between policy and state-action spaces","venue":null,"work_id":"697c119d-0437-4d7a-b315-552a45a9e813","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.537762Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:d78fbb3d11e55be9fb837b49a1c103d9c55d1f50e28fe49c45b1611ca997d011","observation_id":"a9aeef1b-a7fe-40fa-8600-2d5e8c36dc54","resolution":{"observed_at":"2026-08-05T12:37:45.061885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.027487Z","title":"The reward isrπ(s, a) = P i zi[log pπ(i|s) − log zi]","venue":null,"work_id":"bc357b87-5e4b-496c-b6f5-22dceb5c9b97","year":2019},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.757521Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:34bcf005106a5a15937a5fa2673181546025a862a2a43e4ce2c20c5a885c19a0","observation_id":"c10c0bf0-b641-4ffe-83d7-6b67e25d83fe","resolution":{"observed_at":"2026-08-05T12:37:45.031379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.017176Z","title":null,"venue":null,"work_id":"a6e4f597-76d1-42e2-a4b9-5af7f653fa70","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.843902Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:780cf1eb6950c1be3f244117da529d59b59050d56f89926b35569f6e654a0e4d","observation_id":"bf70a841-3077-48e5-9eeb-61078b2c0de7","resolution":{"observed_at":"2026-08-05T12:37:45.020228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.007243Z","title":null,"venue":null,"work_id":"be6bfaf2-8f78-42e6-a1ba-87b8782db7f2","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.902934Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:9321795785c69c9f4b19931b5a62807dd099b8c9bb817ae70d4039c63775d4f5","observation_id":"e2bf02d1-78b0-4fe9-b301-dc9c0ef871f9","resolution":{"observed_at":"2026-08-05T12:37:45.010369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:44.996161Z","title":"This results in anintractable policy divergence with Hessian 16 GTML 2025 HC(θ) = Es∼ωπ F (θ) + X i βiϕ′′(bi − Vci (θ))∇2 θVci (θ) θ=θk","venue":null,"work_id":"bed9a35b-4057-4569-a7df-827a715f2cd6","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.993772Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:80845dd4e91ab71afe75cfb97598bca824d1a0356f432b9c2c8f3305ee275d6e","observation_id":"e82d5808-1bfc-4614-9f81-0debb65398b8","resolution":{"observed_at":"2026-08-05T12:37:44.999360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:44.985167Z","title":"17 GTML 2025 When this standard geometry is restricted to the manifoldΩ, i.e","venue":null,"work_id":"7196a4ba-4f44-480b-8c3c-c7971f36e0ec","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:43.077827Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:5f911bb22b12652d9e34780094949d1a8410a9356309e2074065bb5b19e12f60","observation_id":"c0433396-15d7-4f67-b278-5d0b262b1b41","resolution":{"observed_at":"2026-08-05T12:37:44.988359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.068581Z","title":"Definition C.1(Successor Representation)","venue":null,"work_id":"2a9a60c1-5148-4348-94de-77baccba4167","year":2021},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.484428Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:23498d7b4f8ed12cbcd7b936675cb3d535688ca2edf506d9084ad3e3ab6a4167","observation_id":"69823b71-98d0-4259-bac2-dcf6352681f2","resolution":{"observed_at":"2026-08-05T12:37:45.071461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04426","last_updated":"2026-07-31T09:26:16Z","snapshot_observed_at":"2026-08-05T23:09:19.037616Z","submitted_at":"2025-01-08T11:20:48Z","title":"Dual-Force: Enhanced Offline Diversity Maximization under Imitation Constraints","version":2},"cited_work":{"arxiv_id":"2501.04426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04426","snapshot_observed_at":"2026-08-05T12:37:43.991437Z","title":"Dual-Force: Enhanced Offline Diversity Maximization under Imitation Constraints","venue":"cs.LG","work_id":"3922a36f-c5db-45c9-abc5-f82bcf1a554c","year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.477513Z"},"links":{"cited_paper":"/paper/2501.04426","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:9a412d448c9a87577bb8d27f9a7776b4bbafe9077073af034131254573399032","observation_id":"d3426bb7-af16-429d-8bb2-cc5bfcfd3252","resolution":{"observed_at":"2026-08-05T12:37:44.142127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-07-06T06:23:52.853341Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-05T12:37:41.228201Z","title":"Diversity is all you need: Learning skills without a reward function.arXiv preprint arXiv:1802.06070,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.228201Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:09a4b37b6a7b8cc36dede8f7a0f20aeb5ac2f99245afcd63af9a930d1093eb00","observation_id":"b1fc9aea-a97a-4876-811b-c0960063ca8f","resolution":{"observed_at":"2026-08-05T12:37:41.228201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:44.974226Z","title":"Motivation for a General Hessian FrameworkThe existence of at least two distinct, natural geometries on the same occupancy manifold is a key insight","venue":null,"work_id":"fbdc940d-b769-4303-bc0a-1d63b855f7cd","year":2007},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:43.138992Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:04ea358f54c08d69fcd198a6bda092fdc9bb4adc176b2fea4a16df7aae58d0af","observation_id":"14ad5aa8-9218-485c-9508-bfe56b4e9f54","resolution":{"observed_at":"2026-08-05T12:37:44.977412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00669","last_updated":"2022-01-04T14:40:18Z","snapshot_observed_at":"2026-07-06T11:14:53.651087Z","submitted_at":"2021-06-01T17:56:13Z","title":"Discovering Diverse Nearly Optimal Policies with Successor Features","version":2},"cited_work":{"arxiv_id":"2106.00669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00669","snapshot_observed_at":"2026-08-05T12:37:43.271906Z","title":"Discovering Diverse Nearly Optimal Policies with Successor Features","venue":"cs.AI","work_id":"6a8ff6e7-699e-40e7-b638-5b0fd2374de0","year":2021},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.318169Z"},"links":{"cited_paper":"/paper/2106.00669","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:7345d60d511906d7a3901916aace92d9b0dbc4127bc4c21382255def174af027","observation_id":"785880e8-847f-4a4d-b36e-ed8247e1eb0f","resolution":{"observed_at":"2026-08-05T12:37:43.327076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.097593Z","title":"Prompt, plan, perform: Llm-based humanoid control via quantized imitation learning","venue":null,"work_id":"d703fe87-e271-4175-bf3e-d5059b00c85a","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.172013Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:9db054923d8abf42655b0b9bac65f328b9bf376d2086fb4787786a69bee84a96","observation_id":"577f2040-8e0c-4fc8-84f9-032c966a58e6","resolution":{"observed_at":"2026-08-05T12:37:45.100499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.077705Z","title":"∞X t=0 γtf (st, at) # = Es,a∼dµ π [f (s, a)] (5) 8 GTML 2025 Proof. (1 − γ)Eτ ∼π,µ","venue":null,"work_id":"3664efa3-f3ef-417f-8d2d-6c8e1bee8c21","year":2023},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.447186Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:cd51442f529b7ab59b167c23a580ec2728d0f09f19f54b362e868194b3f0c02b","observation_id":"e2546c89-beba-4e33-9484-133f4faf63b9","resolution":{"observed_at":"2026-08-05T12:37:45.081576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:42.043518Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.043518Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:0bd5a2635424621910649fe4b7ff8d8fb320a6030ae7a09b405f0ad5a9cb59ec","observation_id":"e23415ff-ead5-4ac1-be5c-778fe12aa0a4","resolution":{"observed_at":"2026-08-05T12:37:42.043518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09930","last_updated":"2024-06-03T09:46:32Z","snapshot_observed_at":"2026-07-31T06:09:52.035945Z","submitted_at":"2024-03-15T00:09:47Z","title":"Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features Critics","version":3},"cited_work":{"arxiv_id":"2403.09930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09930","snapshot_observed_at":"2026-08-05T12:37:44.388653Z","title":"Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features Critics","venue":"cs.LG","work_id":"f817f490-2704-4d9d-943f-a8b561fcef5c","year":2024},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.368134Z"},"links":{"cited_paper":"/paper/2403.09930","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:1a2e262edd2e467547b61eb6180d481b0bef19b300ccda8ddced2ed4f2058820","observation_id":"40b258de-e9bb-4761-8430-f7f02e90b5ad","resolution":{"observed_at":"2026-08-05T12:37:44.503773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-02T15:05:52.307944Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-05T12:37:41.314647Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.314647Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:89c1e7c81caae01b29d281b9ec8c3b35e674fc2a0901b4418d2c40db4bfd8660","observation_id":"b5e69283-05ea-44f4-a252-07ef7c669a48","resolution":{"observed_at":"2026-08-05T12:37:41.314647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:37:45.106805Z","title":"cc/paper_files/paper/2019/file/873be0705c80679f2c71fbf4d872df59-Paper.pdf","venue":null,"work_id":"39d4f96f-f116-4abe-83c4-82b419ebe288","year":2019},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.701622Z"},"links":{"citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:ed45e14ea0055b86ebb3a43dd00a96b9574c2c7d9aaf2ff9755ae746603469fb","observation_id":"6b51656a-4d66-476c-bf2c-b372f13c1876","resolution":{"observed_at":"2026-08-05T12:37:45.109888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-05T12:37:41.845185Z","title":"A unified view of entropy-regularized markov decision processes.arXiv preprint arXiv:1705.07798,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.845185Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:2ba5fb5834f21150bd151dad1543acbed528fd92ca6b732b3ae590111d8ebb99","observation_id":"fe7a6825-0ebf-4860-99c5-caa4cffe3680","resolution":{"observed_at":"2026-08-05T12:37:41.845185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03787","last_updated":"2022-02-16T10:01:00Z","snapshot_observed_at":"2026-07-06T11:16:49.764856Z","submitted_at":"2021-06-07T16:51:07Z","title":"Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint","version":4},"cited_work":{"arxiv_id":"2106.03787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03787","snapshot_observed_at":"2026-08-05T12:37:44.647030Z","title":"Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint","venue":"cs.LG","work_id":"d57f9e9c-e5c3-4f99-8dcd-dfb082ee5850","year":2021},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.266986Z"},"links":{"cited_paper":"/paper/2106.03787","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:c48469e2124a282d81c44c012ce834c12dc543909c632de2718ba756b4bc6441","observation_id":"8ba514d3-52d7-4f4c-b52e-f0152f3eb758","resolution":{"observed_at":"2026-08-05T12:37:44.810808Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-05T12:37:41.141219Z","title":"Peter Dayan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.141219Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:df0d835ea31d0c49a80b6d466b53f184f461fae47ba27a70c94c5cf25254e7f7","observation_id":"0003b65f-ac2a-4d90-bd5a-7a38a7dc51b4","resolution":{"observed_at":"2026-08-05T12:37:41.141219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05030","last_updated":"2020-01-27T18:14:54Z","snapshot_observed_at":"2026-08-04T08:10:28.790873Z","submitted_at":"2019-06-12T09:39:05Z","title":"Fast Task Inference with Variational Intrinsic Successor Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05030","snapshot_observed_at":"2026-08-05T12:37:41.422027Z","title":"Fast task inference with variational intrinsic successor features.arXiv preprint arXiv:1906.05030,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.422027Z"},"links":{"cited_paper":"/paper/1906.05030","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:f1dac7a376474e6a7c52f7ce4cb637a1fc08efd52569c398b375c4e4f9f9ecc4","observation_id":"cbecf1e9-e25b-42d0-a701-e49ea4ca7953","resolution":{"observed_at":"2026-08-05T12:37:41.422027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T12:37:42.090426Z","title":"John Schulman, Sergey Levine, Philipp Moritz, Michael I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.090426Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:bf2c94a521fed05f111cf3b6a83f536aec02dda24c2b897536f353838c494524","observation_id":"b588e5e9-9603-43e3-81cf-0272262e8a24","resolution":{"observed_at":"2026-08-05T12:37:42.090426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":14,"verified_exact":4,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2509.01432."}