{"as_of":"2026-08-08T11:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d745afc33accace16b58e4cc98c7a9ace98767d6637c9fb761d38299ab1ca5cf","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:53:15.489700Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:12:57.430291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T08:17:36.523927Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"cited_work":{"arxiv_id":"2506.07054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07054","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a8aad141-a1c4-4a8a-b272-8424a7e61d51","year":2025},"citing_paper":{"arxiv_id":"2602.01505","last_updated":"2026-05-06T16:04:38Z","snapshot_observed_at":"2026-08-04T18:30:12.465245Z","submitted_at":"2026-02-02T00:35:42Z","title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:57.430291Z"},"links":{"cited_paper":"/paper/2506.07054","citing_paper":"/paper/2602.01505"},"observation_digest":"sha256:685ce388f5dadeb274347541f225d94b9e48e0c20ccd17afdb034e73f450fdd9","observation_id":"ada1f7a4-89f3-4e80-98c2-0ba288ee1c01","resolution":{"observed_at":"2026-05-16T08:17:36.525446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07054/citation-record","integrity":"/paper/2506.07054/integrity","json":"/paper/2506.07054/citation-record.json","paper":"/paper/2506.07054"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.402520Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift.The Journal of Machine Learning Research, 22(1):4431–4506, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.402520Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:c688634f69d20c7bb9c731afbfb045ee86fdbddcdd1003c300029d3b8eab21d6","observation_id":"56c0e748-0fab-45bb-bd14-b08996d7944f","resolution":{"observed_at":"2026-08-07T05:53:15.402520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.735590Z","title":"Natural actor- critic algorithms.Automatica, 45:2471–2482, 11 2009","venue":null,"work_id":"2672f0d6-a90c-4112-bed1-9397ddc3c259","year":2009},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.407155Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:22186b7af112c962679b69f26579a4a8100455c509fb4f943b50440ef11f6160","observation_id":"b3422e75-af8d-4b42-81e8-c13b283b4395","resolution":{"observed_at":"2026-08-07T05:53:15.739448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.724693Z","title":"Finite-time analysis of single-timescale actor-critic.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"55673072-7a10-4036-9f2f-7474f20b0400","year":2024},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.411205Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:6701a287b0dd07d7809e4fc282f383cacef1d7e568d06b5a004f0699c1dd8f74","observation_id":"2a85ad48-e844-4c5d-932c-ce636f67b2a4","resolution":{"observed_at":"2026-08-07T05:53:15.728469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.713393Z","title":"Bellemare","venue":null,"work_id":"c6166c25-0a33-42ee-b1eb-1206fa6bc00b","year":2019},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.415171Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:254496d5f5542e92f4ca06d2d4a22d002af782fd89193e9a13f7598c0284eaa1","observation_id":"43763294-3e93-43a4-b32b-352057071b5e","resolution":{"observed_at":"2026-08-07T05:53:15.717309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03654","last_updated":"2018-07-30T18:02:11Z","snapshot_observed_at":"2026-07-06T06:22:45.639530Z","submitted_at":"2018-02-10T22:22:03Z","title":"Beyond the One Step Greedy Approach in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1802.03654","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.03654","snapshot_observed_at":"2026-08-07T05:53:15.520341Z","title":"Beyond the One Step Greedy Approach in Reinforcement Learning","venue":"cs.AI","work_id":"cd3b00d4-0b23-4bd3-9176-cf09035a0963","year":2018},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.419078Z"},"links":{"cited_paper":"/paper/1802.03654","citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:888b880262268d102f9a2b150733f4e517fa7f23e74ee37d0e5d53b790e96a84","observation_id":"81b3254c-48b1-4fee-9ddf-acd97723552c","resolution":{"observed_at":"2026-08-07T05:53:15.526463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.702769Z","title":"Kakade, Karan Singh, and Abby Van Soest","venue":null,"work_id":"cba36ab7-f964-410f-8fcb-001e94bb0b07","year":2019},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.423850Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:7d6932785853417b88deaff7512948bd37d77850f4d606b4206491940ebd8da1","observation_id":"51ece1e1-2ea5-4ff7-9766-b6dc50795aea","resolution":{"observed_at":"2026-08-07T05:53:15.706317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.692172Z","title":"Actor-critic algorithms","venue":null,"work_id":"7f0e60a8-8682-408d-801d-7589f6439857","year":1999},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.428386Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:9a4ed2cd8ce4b7c9e50f13a9d66d9f97d2347c16d6b3b2d2af8626905abb7527","observation_id":"57b80b14-6b61-46d9-83f0-f94a58620f0d","resolution":{"observed_at":"2026-08-07T05:53:15.695828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.680198Z","title":"Policy gradient with tree search (PGTS) in reinforcement learning evades local maxima","venue":null,"work_id":"970182fa-54d2-4e2b-86b5-a09301f74d14","year":2024},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.435726Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:4fd095014ad5bc2cd8c6b773794b9049aa9a24dca830f713eb5a18e8bc1ce683","observation_id":"af50b33e-cec3-45cf-a19d-9e94afbfea7e","resolution":{"observed_at":"2026-08-07T05:53:15.684281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.668892Z","title":null,"venue":null,"work_id":"3c28674b-0b06-4cc7-9b42-829b8db638e7","year":2024},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.439433Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:66a4162e9822e5c6c8378ba144fefb31f2773c97fb0321ccbe9a5aff6ff12209","observation_id":"b7909ac8-de03-407f-80da-d6f6a105ef17","resolution":{"observed_at":"2026-08-07T05:53:15.672487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.658061Z","title":"Elementary analysis of policy gradient methods, 2024","venue":null,"work_id":"166de5e2-c24a-4b19-8f56-076562292f0b","year":2024},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.442956Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:07f43c97c84fa143d8b5436c72367306d2536a7c1f4303fb076b63b3962c9ba8","observation_id":"a08650c2-ebf2-4ecf-9276-7e15532c7613","resolution":{"observed_at":"2026-08-07T05:53:15.662105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.647793Z","title":"On the global conver- gence rates of softmax policy gradient methods","venue":null,"work_id":"340e4dc9-014a-4cfc-a836-d3166b382c55","year":2020},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.446740Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:b7471a50ee273a395afd985284641fb0f68460a108457f4dbb321b3316d88689","observation_id":"bc90bb24-e7bf-416f-8c44-9edb6cbf28f3","resolution":{"observed_at":"2026-08-07T05:53:15.651383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.637356Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"8da476e1-d271-4917-b986-d7def4621e75","year":2015},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.450997Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:dd81b2aca4bf9ea637174938d2d537ad05884aca014d3c6ec38ece3d11ad3844","observation_id":"1e918b11-ad93-439d-8d9c-730f3fba57df","resolution":{"observed_at":"2026-08-07T05:53:15.640881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.625550Z","title":"Policy mirror descent with lookahead, 2024","venue":null,"work_id":"bf41d366-1f9a-470a-b058-7df7db77ecf9","year":2024},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.454437Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:b26a5626b3a8759e57c2b7fb85dce01d4f3db076130b97c229386cdfd1e2eb67","observation_id":"7eb16917-a3a7-4ac4-8ac6-0ec7260376bf","resolution":{"observed_at":"2026-08-07T05:53:15.629318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.457879Z","title":"John Wiley & Sons, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.457879Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:2eb6b475afe62d6e30474ab3d929f625630d6d728104e074c56612df6c706fc0","observation_id":"a2d3ff54-86d7-456c-9820-2ef2c66ea579","resolution":{"observed_at":"2026-08-07T05:53:15.457879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.461456Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.461456Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:a6b2a421c7cf9d7104ddf3a16887a5aa2a74eed76a640dc442bd134ac2de9e8f","observation_id":"ec476048-53ed-420f-823f-3c0793c92f18","resolution":{"observed_at":"2026-08-07T05:53:15.461456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.600400Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":"efb6c3b0-ca15-4c3e-acb4-d330c597e162","year":2015},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.464987Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:6462e6683fde2e7dcc9edb36cacd41ef96f2c630ed27e0c5a69f25c8e9038b1f","observation_id":"34db7301-cfab-47c5-b2da-56ab6f3284c1","resolution":{"observed_at":"2026-08-07T05:53:15.604094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.589265Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play.Science, 362(6419):1140–1144, 2018","venue":null,"work_id":"b0d5d371-f660-4f80-b9d4-7a1d73b0dea9","year":2018},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.469607Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:f6df4450e06cbb9fab5e66bab311fcaf1767fdcea37df477fecf1d787ff47f20","observation_id":"68dbb265-dee3-47f6-984a-c97c6eda7e5c","resolution":{"observed_at":"2026-08-07T05:53:15.593271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.473939Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.473939Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:06984d3614ed76410292899e47261a343d9d70809c79a6a9f7131b02937200c2","observation_id":"3dcbdbcf-1631-4f47-aaa6-d304346c9057","resolution":{"observed_at":"2026-08-07T05:53:15.473939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.568768Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"4442b3de-3eab-4491-8487-43d3f6befd70","year":2000},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.478052Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:0397602cbd15e9a8755c80849a040f13f0bcc5c929c4d96d3e562d893d8298b3","observation_id":"c23fe72e-c3e4-43d5-a58f-114fe4743eb8","resolution":{"observed_at":"2026-08-07T05:53:15.572872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.557390Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"138f412c-bbed-4c02-8097-b47e4b0fffa8","year":1999},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.482171Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:61059e85fac0560030ac5424a5bce81c26c7a126c8172dfbcdf8a2ef9bd64907","observation_id":"95b5e946-8bc8-42ee-9e6e-91def601df2d","resolution":{"observed_at":"2026-08-07T05:53:15.561490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.546449Z","title":"On the convergence rates of policy gradient methods, 2022","venue":null,"work_id":"35188a1c-4669-42e3-b781-8583bc94a932","year":2022},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.485818Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:ce5723fd8169c1718e5f8a5e77668f9549222bf0735963826db4b3ddb65e9b16","observation_id":"a92f577c-8c28-4350-b9fc-696876e7c04e","resolution":{"observed_at":"2026-08-07T05:53:15.549983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:53:15.535134Z","title":"On the convergence rates of policy gradient methods.Journal of Machine Learning Research, 23(282):1–36, 2022","venue":null,"work_id":"84ea1ee6-e5e4-4b40-a4a2-cf674cdf0994","year":2022},"citing_paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:15.489700Z"},"links":{"citing_paper":"/paper/2506.07054"},"observation_digest":"sha256:53ba3044bcc47530ff5823ae8c01ecd25a7affceeb775a89ac0cd7eef499f235","observation_id":"86e9b9f1-d77b-4dec-a355-26195e177e7e","resolution":{"observed_at":"2026-08-07T05:53:15.539115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07054","last_updated":"2025-06-08T09:28:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:27:02.286806Z","submitted_at":"2025-06-08T09:28:11Z","title":"Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2506.07054."}