{"as_of":"2026-08-08T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3114619b044c953f3a22ce71672e9b77b755d1cf487821e90c1707ee46bac4a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:47:50.149885Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01597/citation-record","integrity":"/paper/2506.01597/integrity","json":"/paper/2506.01597/citation-record.json","paper":"/paper/2506.01597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.923100Z","title":"Practical kernel-based reinforcement learning","venue":null,"work_id":"239630c6-8043-4596-874a-b66e9bbbae15","year":2016},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.631890Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:0fa6ef48630a30a8395ee468f26f0970fb38467b615a472042680e3f7a7e8bc8","observation_id":"4b7b9f4c-72a4-46d2-b80e-6957c595ad6f","resolution":{"observed_at":"2026-08-07T11:48:04.956885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.667734Z","title":"Optimization methods for large-scale machine learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.667734Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:e1c8bc61c3f184cfa2959adf16a579c3cc944f68c0f53318cbe2761126413be1","observation_id":"3653c063-a122-4e06-be01-65c5a2d96b93","resolution":{"observed_at":"2026-08-07T11:46:59.667734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.867100Z","title":"A tutorial on support vector machines for pattern recognition","venue":null,"work_id":"c8d1d492-16f0-40f7-8d31-4b4e2c17b068","year":1998},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.701880Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:d4ca3f6026ead2632444de6efa69498ec0014f056c592e2247aea823cb9b513f","observation_id":"38d48e19-5543-48d1-9557-ebf4977680f1","resolution":{"observed_at":"2026-08-07T11:48:04.876836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.837172Z","title":"Second-order kernel online convex optimization with adaptive sketching","venue":null,"work_id":"37651301-2fac-42cb-99df-0400be3f83df","year":2017},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.745345Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:410ab9fa08c349a2eb8888dfb723428e0a4ef056285e6d7785d06f3f5503b5d8","observation_id":"13bed701-f904-4d3c-a4ed-4720ea77e7aa","resolution":{"observed_at":"2026-08-07T11:48:04.847498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.803123Z","title":"Efficient second-order online kernel learning with adaptive embedding","venue":null,"work_id":"d0041d74-bb3d-46d7-88d2-0ec22d912f97","year":2017},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.790905Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:21f6a71fb5e40b701d0821de4617e2e12ae02e9ee585cdc4aae896fc734680ed","observation_id":"833dadd6-932b-483e-a109-ac35a1e76fa7","resolution":{"observed_at":"2026-08-07T11:48:04.817517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.777523Z","title":"Super-universal regularized newton method","venue":null,"work_id":"77f32e44-a4aa-409d-9487-e2e24055ccf2","year":2024},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.844612Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:453e84ca943089c8ebc12a17407036a3f1b3fcbee280b82399aa0ee85a538f38","observation_id":"66a6884c-38b4-44ff-b2d4-ff98d238c5bd","resolution":{"observed_at":"2026-08-07T11:48:04.787831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.742202Z","title":"Approximate newton methods for policy search in markov decision processes","venue":null,"work_id":"ad430978-2692-48f7-8ec6-50be0a2981a3","year":2016},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.880899Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:171cceeb467de7e52797b4463724ebdb41f883930801978d39d9a4afe65e1be0","observation_id":"3d5ebd50-3cb1-4545-8c89-e026517115d8","resolution":{"observed_at":"2026-08-07T11:48:04.756638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:46:59.916768Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.916768Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:5149ef88b028a9be65cf167836aa61db7038b401d80b04b69cb4f826781124ec","observation_id":"97fcdeef-69c1-4c48-8455-3e7928ef8eb5","resolution":{"observed_at":"2026-08-07T11:46:59.916768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.698054Z","title":"Quasi-newton trust region policy optimization","venue":null,"work_id":"a5d8b13a-6a1d-4e24-b04e-03dbf4392d81","year":2020},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.963385Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:0fb71b3621c223e919773affa5dc209c67f4c591f08f81569fa93dc28458caf5","observation_id":"dbd4ba99-2f8b-4d8e-9153-fce6679a0e5c","resolution":{"observed_at":"2026-08-07T11:48:04.708524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.659863Z","title":"Convergence and decomposition for tensor products of hilbert space operators","venue":null,"work_id":"e13b1f2f-1ef8-45a3-a0df-b2d345406f25","year":2008},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.000150Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:f8d2f76968f4a77347eb789d980fabc03e1c9a57cefb06ff0615230f10e71ff3","observation_id":"f4079ccf-9e7c-470a-acf0-0f3c0e83f18f","resolution":{"observed_at":"2026-08-07T11:48:04.677002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.625354Z","title":"The conjugate gradient method for optimal control problems","venue":null,"work_id":"899d7fa6-e5a0-48b0-9d91-f44baf8b7f01","year":2003},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.032444Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:0c0836884d075ab90e1831c87cae1361fd1e196b1e9de0d2fccf25e12bc40fd0","observation_id":"bc939fe8-1343-4f21-9533-c852ae7b9509","resolution":{"observed_at":"2026-08-07T11:48:04.637324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.591212Z","title":"Fastfood-approximating kernel expansions in loglinear time","venue":null,"work_id":"55ee2c24-1e5c-46ee-a407-a03dc6583e61","year":2013},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.067926Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:8198a19b41c78a7ff9327c1881f5188d5d02ffc1ac740558547a51d51c286181","observation_id":"fe4ca90f-4ebe-4a9f-9738-6534b912330a","resolution":{"observed_at":"2026-08-07T11:48:04.608166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.546679Z","title":"Dynamic asset allocation exploiting predictors in reinforcement learning framework","venue":null,"work_id":"62e6ed48-4183-4084-ba19-c5efca2aa689","year":2004},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.111348Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:5439883e3e2b66db26b3611a4e2f58d32e610a8550849ab2dd96daf476b65f21","observation_id":"4b84e4da-8778-4e93-95e0-27ebad03447e","resolution":{"observed_at":"2026-08-07T11:48:04.572162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.513917Z","title":"Parameterizing non-parametric meta- reinforcement learning tasks via subtask decomposition","venue":null,"work_id":"a4dc4714-240f-47cb-988c-b894bacbf894","year":2023},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.149331Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:cc245a0f2b50627011d8f3752b63b5bef2c810f18792fcf23fa428ebdb2d7484","observation_id":"e1d471c3-68e0-4839-859e-f1e1a4992d63","resolution":{"observed_at":"2026-08-07T11:48:04.529875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.474916Z","title":"Modelling policies in mdps in reproducing kernel hilbert space","venue":null,"work_id":"15e08742-746a-4b58-be37-d6f82b05186a","year":2015},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.183973Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:9fdcc713ce5add119cdd35c5426dc91eb296e7623b267b92f0c094d9ef830fed","observation_id":"f8f600a6-3d46-4ec1-8724-ed06dc5ad401","resolution":{"observed_at":"2026-08-07T11:48:04.488772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.442288Z","title":"Approximate newton policy gradient algorithms","venue":null,"work_id":"69dd6069-0a41-4797-bee8-f345040a39e0","year":2023},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.220120Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:0732349ccc25122c881e218de3c838b79f644bc2341e63a9ad5264cc53e5c99e","observation_id":"6b61afb5-dbb2-4525-9a9a-987a1dcc4bd5","resolution":{"observed_at":"2026-08-07T11:48:04.454621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.411276Z","title":"Large scale online kernel learning","venue":null,"work_id":"0c265873-761b-45c1-b943-5e8aebd7b8aa","year":2016},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.264079Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:238400c6d9e866855d4a04c8ea1987a7c6a2ea3b29a070ebd8643eedb6e59383","observation_id":"7f25bcc2-dac5-46eb-acdd-6250d14cb206","resolution":{"observed_at":"2026-08-07T11:48:04.421894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.378989Z","title":"A cubic-regularized policy newton algorithm for reinforcement learning","venue":null,"work_id":"1e0104f4-bdf9-41c6-9d69-54e08a8e3180","year":2024},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.307378Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:6f10cfd2e147b0c338d3fdb54d9c367ea9bf0733f4eeccd067909066449f735d","observation_id":"fc1380d5-8eb6-40cf-8ff1-2058ef874c43","resolution":{"observed_at":"2026-08-07T11:48:04.391581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.342802Z","title":"Methods for calculating fréchet derivatives and sensi- tivities for the non-linear inverse problem: A comparative study 1","venue":null,"work_id":"d02e4cd9-163d-4a5c-bf85-9e8a7715480b","year":1990},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.341786Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:4805972a9ab2db7bd691e48c4e4bd00a7c2923acdd3c8bf67fcce737c17f1487","observation_id":"7231c35e-353e-4fc9-96fe-a75b203814e7","resolution":{"observed_at":"2026-08-07T11:48:04.356665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.312849Z","title":"A scalable kernel approach to reinforcement learning","venue":null,"work_id":"4f41cd02-7f85-4ee5-a6bf-586fd8d0c312","year":2025},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.378817Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:dfb5ed270bf489af7262d41eda48e9b015b3c022e0397bb420a42b315e71cdb6","observation_id":"5ea5a9df-5caa-42eb-a7bb-bb25694c7b8b","resolution":{"observed_at":"2026-08-07T11:48:04.323716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:04.281475Z","title":"Nonparametric return distribution approximation for reinforcement learning","venue":null,"work_id":"4bd6bbb8-14ad-47dd-bc15-315ec2b9d331","year":2010},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.422894Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:dc0096c2621d4c44818204cb562484f1e7e4499bd2fb0d7e7dcb459d31d574d1","observation_id":"8bb6f7b7-f84c-4c9d-a991-44f6b2920cc5","resolution":{"observed_at":"2026-08-07T11:48:04.292540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:48:03.980580Z","title":"Universal approximation using radial-basis-function networks","venue":null,"work_id":"ff6a3377-d631-472a-be07-7d4be3958bcc","year":1991},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.458400Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:e4167366ae6fd911cc404629a9e88ce3cbcaa41bc16e6d6dcdd54c1adf58ffc3","observation_id":"3329dfd0-b5d1-4e86-ac10-4ebe278ef292","resolution":{"observed_at":"2026-08-07T11:48:04.257731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:52.182102Z","title":"Stochastic policy gradient ascent in Reproducing Kernel Hilbert Spaces","venue":null,"work_id":"29552875-b257-43c8-a4e1-13631c0e90a3","year":2020},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.509650Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:aa0890f7d355f62d6bb56a91c24ec709f32c066e03c9e49a58adace0366ac13f","observation_id":"003b426f-f54e-4705-85af-70a930919bdf","resolution":{"observed_at":"2026-08-07T11:47:52.213074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:52.056911Z","title":"Policy gradient for continu- ing tasks in discounted markov decision processes","venue":null,"work_id":"6f5c4693-cddf-4bd4-8361-aa47736da478","year":2022},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.567753Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:25f260fed54b0e8be14568705b2b7dd68dc908d321c629fd7c7a11f3acf76ab4","observation_id":"81c94938-e999-4a9a-9c0f-27865210e575","resolution":{"observed_at":"2026-08-07T11:47:52.122310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.992921Z","title":"A generalized representer theorem","venue":null,"work_id":"c48ce4cd-b350-4973-8b19-47bdef859c30","year":2001},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.600731Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:f2127eb8a8de03cc42d6defaeb4a252338d5d75ed09458351251fe97f74f6c35","observation_id":"a91b2baf-e769-48e9-8fd6-0c563ae65891","resolution":{"observed_at":"2026-08-07T11:47:52.016067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.913003Z","title":"Hessian aided policy gradient","venue":null,"work_id":"088f88b4-780d-487f-99d4-5bb9202eb5e6","year":2019},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.637328Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:7b7922413cf9ff027e1b9a00b96a1e52707f7bbb61e4eea35677a32eba8cd1f2","observation_id":"23626f5e-bdab-411a-8479-c0da69601e11","resolution":{"observed_at":"2026-08-07T11:47:51.935781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.845215Z","title":"Sutton and Andrew G","venue":null,"work_id":"b4f54e54-2cc3-477a-9311-b3f74858531e","year":2018},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.668055Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:b6131a909272f969bf92c633fbe014700a82527534f4c1a689f0e01265e447eb","observation_id":"721a06b7-58e8-412d-9f64-e2b8cc9f8b8a","resolution":{"observed_at":"2026-08-07T11:47:51.879277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.781528Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":"ec4b106a-2534-451f-b1ff-336151445844","year":1999},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.703265Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:6ac97ff44bebe8c80207f8865852a47e290216cef90b69b619d1ff25631fbd7a","observation_id":"780da708-98aa-4f7f-9af0-d8ba102221df","resolution":{"observed_at":"2026-08-07T11:47:51.811639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.580446Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"e42b0b9a-e631-42f2-90f7-bc06b904b0ad","year":2012},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.747483Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:b124a2cb64d585457cd30fb7058f45f8d8a7b8c442410e0038dd8388427f1822","observation_id":"db8fda62-43a1-451d-be2c-f9c699a1f68f","resolution":{"observed_at":"2026-08-07T11:47:51.659982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-07T11:47:00.789638Z","title":"Gymnasium: A standard interface for reinforcement learning environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.789638Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:304ea0df17bc3cf453b0bf424ec5a324b7b91bb5870bd1e9ed8904c7106c9449","observation_id":"a5b2a4c8-3792-4df8-aa02-fb2cbf635817","resolution":{"observed_at":"2026-08-07T11:47:00.789638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.395201Z","title":"On the convergence rates of policy gradient methods","venue":null,"work_id":"ae4fff9c-4394-4d79-8bb4-7d0d245008e3","year":2022},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.033620Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:d09147aed3306125b78cac218f01ca77a48d778562ef289b03f145cf15cfc056","observation_id":"02af97c1-5ca6-4bb0-8782-5995bc1b82e6","resolution":{"observed_at":"2026-08-07T11:47:51.488017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.178520Z","title":"Safety aarl: Weight adjustment for reinforcement- learning-based safety dynamic asset allocation strategies","venue":null,"work_id":"fd293792-9b06-483f-8e48-4094088ecbaf","year":2023},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.594886Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:bfc862fb65b6fbdff89482031eeb2176144858c16a894dad2f1d4c41a2ed8998","observation_id":"19576e37-37c5-473e-b4d1-e447101462d8","resolution":{"observed_at":"2026-08-07T11:47:51.261797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:51.022119Z","title":"Global convergence of policy gradient methods to (almost) locally optimal policies","venue":null,"work_id":"9bc66d58-fa00-4b0d-8cc4-5c2da56ed62e","year":2020},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.666149Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:bed169aa4a8925e1776db66968ef55b1107e851140f7231427c7c327b4c4b100","observation_id":"c966317b-dbda-4ec6-aa2d-c657b80d4d5e","resolution":{"observed_at":"2026-08-07T11:47:51.088717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.907428Z","title":"Residual kernel policy network: Enhancing stability and robustness in rkhs-based reinforcement learning","venue":null,"work_id":"50dce9fc-e827-4316-abb3-c8f6e00a0102","year":2025},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.723203Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:3b99a4bb93782efc02f805beaafaac581ddc590daf5aae9e82c9396d5c930c81","observation_id":"f6117b3b-e7c0-458c-b880-c7702b497bf9","resolution":{"observed_at":"2026-08-07T11:47:50.938637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.822606Z","title":"Let Xl(¯hα) = ⟨∇h log πh(xl), ¯hα⟩","venue":null,"work_id":"78cc2f38-48ba-4f38-84ce-4175e80e949a","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.780070Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:c45440a312617310b440868dbb5922dd70ad440a1c91905a5a7c8b49727d548d","observation_id":"eefec5d7-cb49-43c7-8f8c-d4fe312d2f92","resolution":{"observed_at":"2026-08-07T11:47:50.866789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.728652Z","title":"The quadratic form is ⟨H (2) op ◦ ¯hα, ¯hα⟩ = PM l=1 Ψl(τ )T Cova′∼π(·|sl)[K((sl, a′), ·)] ◦ ¯hα, ¯hα","venue":null,"work_id":"1e89c5f9-63fa-4251-a727-0f61d8bb26c8","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.833573Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:ff0bba8e2d96e4b2072eb0d2feb0948cef84821882638be0bb5fb2afa6d0f7bf","observation_id":"c17661dd-2369-47db-8a2b-8af870177b72","resolution":{"observed_at":"2026-08-07T11:47:50.761713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.639126Z","title":null,"venue":null,"work_id":"c91bcd41-7655-437d-8457-b41b8331836f","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.917454Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:5a4f13dc26e3f33e89af903123365c589f7e121bdcf2f235ae0e33c2ea917df3","observation_id":"79e304ea-8a78-47ab-bb4b-31c99d707f03","resolution":{"observed_at":"2026-08-07T11:47:50.668667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.559839Z","title":null,"venue":null,"work_id":"f38685e3-1ebd-4d45-8979-cbcd837b7a79","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:49.988158Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:e00dc3a6b26aa8a68f37b203a71395e263c5deb81fd083b3dd94ac038a84e83d","observation_id":"6c83b39f-e70e-4ee4-9eed-320ffc79e778","resolution":{"observed_at":"2026-08-07T11:47:50.586986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.463197Z","title":"The conjugate gradient method is employed to efficiently solve this linear system, avoiding the high computational cost of directly computing (H + β 2 ∥ ¯α∥I)−1","venue":null,"work_id":"557e4645-90e5-4b06-b081-ee93c612b927","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:50.046535Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:407ad3cf6d9b695d18432b10d6abf02faec1ca77fe2b54c2377d1548cc250354","observation_id":"01608c29-4aaf-4239-bc34-65ba0de52e6a","resolution":{"observed_at":"2026-08-07T11:47:50.492623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.365023Z","title":null,"venue":null,"work_id":"dc0a314c-3e1e-474c-8024-cf23e693c203","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:50.080720Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:0c0157cd25738992e0520bc93a663b0f62f43c1ee0dd3e9af45235b3c75931a7","observation_id":"f067549e-a9fe-47fe-ae8d-823daa821abe","resolution":{"observed_at":"2026-08-07T11:47:50.408207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:47:50.261154Z","title":"To balance optimization accuracy and computational efficiency, we set the convergence tolerance to10−3 and the maximum number of iterations to 500","venue":null,"work_id":"2e0b2aa1-5eed-47a6-a675-5e39aaf2b9fc","year":null},"citing_paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:50.149885Z"},"links":{"citing_paper":"/paper/2506.01597"},"observation_digest":"sha256:b3555b5452555d62adfa52a1e4247b1339592290aab8faae577d40367a3682a7","observation_id":"0da68224-54a2-447d-80f2-e8747929df11","resolution":{"observed_at":"2026-08-07T11:47:50.310407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01597","last_updated":"2025-06-02T12:32:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:35:38.329411Z","submitted_at":"2025-06-02T12:32:52Z","title":"Policy Newton Algorithm in Reproducing Kernel Hilbert Space"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.01597."}