{"as_of":"2026-08-18T18:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09d4604808f7e94535dfb4e611f7f578c5cd047b86b3f6d11c5a0047a8b4d7e7","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:45:35.150536Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.09029/citation-record","integrity":"/paper/2505.09029/integrity","json":"/paper/2505.09029/citation-record.json","paper":"/paper/2505.09029"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.543295Z","title":"”Reinforcement learning: An introduction","venue":null,"work_id":"539200dd-cb22-416f-b89e-ca08ad420737","year":2021},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.040358Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:6289df8c4f3ae138b66f3e60c4ec877a5cc0212eb192fb6fa5c138c37907d273","observation_id":"b214486c-e58f-4253-8f3b-f0f7564568bf","resolution":{"observed_at":"2026-08-15T21:45:35.547841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.527625Z","title":"”Reinforcement learning algorithms: A brief survey.” Expert Systems with Applications 231 (2023): 120495","venue":null,"work_id":"ec37aecf-fb51-4104-b0f5-9319be7d30c2","year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.045488Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:1c628ee8baccc1ece74b8ce8193a0c0318ac47cad7775cf73b5762d986c3b745","observation_id":"cae4ee93-2c40-4817-881e-53a88a3a888f","resolution":{"observed_at":"2026-08-15T21:45:35.533228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.512819Z","title":"”Using reinforcement learning for load testing of video games.” Proceedings of the 44th international conference on software engineering","venue":null,"work_id":"13b70b1e-e6ac-4702-9704-b8bc6a565b6c","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.050151Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:a073a334f8368b9c8a61352033f34fed4ae259f06273888d9cc5ba725d0efaa0","observation_id":"9e7cba20-a200-4130-adee-723c7eba24cd","resolution":{"observed_at":"2026-08-15T21:45:35.517836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.497757Z","title":"”A comprehensive survey of research towards AI-enabled unmanned aerial systems in pre-, active-, and post-wildfire management.” Information Fusion (2024): 102369","venue":null,"work_id":"a3cd0fb0-3950-44f6-8dc4-e714021a07e1","year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.054810Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:78ffac4f095b9dd5c8e412a472a448c4283e22ba3367c84256c376a04c8f49ac","observation_id":"6c3251f6-180d-4827-8cb1-ca76e7cd2591","resolution":{"observed_at":"2026-08-15T21:45:35.503172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.483617Z","title":null,"venue":null,"work_id":"d21cf8a9-e639-4b60-b056-9f0c818629e7","year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.060042Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:7222fdf5905cd4758baeb677909f323815c41dc995edbe1ef252dbf1bde2e18f","observation_id":"30fd499a-75dc-4bcf-b16c-6153aecc0ae8","resolution":{"observed_at":"2026-08-15T21:45:35.488101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-18T10:37:12.291554Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08844","snapshot_observed_at":"2026-08-15T21:45:35.064770Z","title":"”MuJoCo Playground.” arXiv preprint arXiv:2502.08844 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.064770Z"},"links":{"cited_paper":"/paper/2502.08844","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:f7522ec1b6b3195e991b2ddeb7d05d8a38bb7131ac9bddaf09129fabafe01919","observation_id":"0184d00b-5bf5-4fab-ac08-c62caccdaf01","resolution":{"observed_at":"2026-08-15T21:45:35.064770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.466573Z","title":"”Continuous control actions learning and adaptation for robotic manipulation through reinforcement learning.” Autonomous Robots 46.3 (2022): 483-498","venue":null,"work_id":"f0b7dede-eb1e-45af-8e70-5dd94d1b5c7e","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.070259Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:560a78d4b8801524585a2ce25bcd15a730c00465eb324b7141ba5825cf4c91e2","observation_id":"af29866b-345d-4b86-af39-4cf23f056e9f","resolution":{"observed_at":"2026-08-15T21:45:35.472673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.449379Z","title":"”Deep deterministic policy gradient algorithm: A systematic review.” Heliyon (2024)","venue":null,"work_id":"8a83959e-9eed-4d59-8b08-2563cc0c0bc8","year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.074744Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:459fe1c4e166f575ae23dadee595b74fe96a3810562dba6cf9eaa50ffcb1e96d","observation_id":"b5f35a32-d0f8-405b-92c3-84355e64a4ed","resolution":{"observed_at":"2026-08-15T21:45:35.455950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.433562Z","title":"”Addressing function approximation error in actor-critic methods.” International conference on machine learning","venue":null,"work_id":"efd77c72-3115-40a1-a7fc-145072ce27b8","year":2018},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.079309Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:5aeb6b1aff7cf1c7d1bc9e2ce9998967649545d5398a575fda2d1721e1064a6b","observation_id":"503de0fe-97cc-423e-8862-ca89dfbd3465","resolution":{"observed_at":"2026-08-15T21:45:35.439305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.415653Z","title":"”Stable-baselines3: Reliable reinforcement learning implementations.” Journal of machine learning research 22.268 (2021): 1-8","venue":null,"work_id":"74678296-3060-429e-a2b8-fe7bc59be01c","year":2021},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.083839Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:f0c820b24a29388046c43e09f443cc514f6bacdf57c11add2025594232009d06","observation_id":"2020f5a2-5dac-4227-b83e-ced049cbbba8","resolution":{"observed_at":"2026-08-15T21:45:35.421564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14552","last_updated":"2025-07-08T16:00:08Z","snapshot_observed_at":"2026-08-16T12:49:12.086197Z","submitted_at":"2025-03-17T22:08:02Z","title":"Eyes on the Environment: AI-Driven Analysis for Fire and Smoke Classification, Segmentation, and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14552","snapshot_observed_at":"2026-08-15T21:45:35.088192Z","title":"”Fire and smoke datasets in 20 years: An in-depth review.” arXiv preprint arXiv:2503.14552 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.088192Z"},"links":{"cited_paper":"/paper/2503.14552","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:8af26101a9b0bf81508ca5698e985cc85b6e25ae83c05ddcebc004b81bb06b91","observation_id":"c9a48528-1cfa-4590-a1cd-9d4ee9ef4617","resolution":{"observed_at":"2026-08-15T21:45:35.088192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.398752Z","title":"Deep Reinforcement Learning Hands-On: Apply modern RL methods, with deep Q-networks, value iteration, policy gradients, TRPO, AlphaGo Zero and more","venue":null,"work_id":"3235d1d6-2210-44db-a320-2083d4da3407","year":2018},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.092822Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:66ae81528b1ddd1ac09101f56fb9c19d3c33fc6484a7f9fea71a77c8b50ef650","observation_id":"0ce57820-9eae-4921-ad16-ec3d785ba5c2","resolution":{"observed_at":"2026-08-15T21:45:35.404273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.382771Z","title":"”AlphaZero.” Deep Reinforce- ment Learning: Fundamentals, Research and Applications (2020): 391- 415","venue":null,"work_id":"ad524d6b-aa6d-47bb-80aa-89bd85313201","year":2020},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.097469Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:151d85e1a1de2985e652f7b46a02ac23c10c3a3561af43f383d87db31c8683aa","observation_id":"eda5f139-b497-4678-85be-b4cc802f87e9","resolution":{"observed_at":"2026-08-15T21:45:35.387544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03495","last_updated":"2023-10-19T04:37:25Z","snapshot_observed_at":"2026-08-16T15:35:36.835145Z","submitted_at":"2023-05-04T15:15:22Z","title":"Automatic Prompt Optimization with \"Gradient Descent\" and Beam Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03495","snapshot_observed_at":"2026-08-15T21:45:35.101965Z","title":"”Automatic prompt optimization with” gradient descent” and beam search.” arXiv preprint arXiv:2305.03495 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.101965Z"},"links":{"cited_paper":"/paper/2305.03495","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:4bab5065bbe36533e9219be8cdbd81e1985b0e3af711971fcea5c0d3d640d9a3","observation_id":"866b4b9a-3db6-4e01-aa06-335aa0eef24b","resolution":{"observed_at":"2026-08-15T21:45:35.101965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.366605Z","title":"”Simulation-guided beam search for neural com- binatorial optimization.” Advances in Neural Information Processing Systems 35 (2022): 8760-8772","venue":null,"work_id":"82f39c85-a7f3-4daf-97c9-418304b523ae","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.106933Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:c16c736d78f08e1eebcb95311ceed7c7f7c738a641838b8ff3ebc45207988679","observation_id":"c8ccdd19-8117-4251-94a3-3953d7dbfa9b","resolution":{"observed_at":"2026-08-15T21:45:35.371794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.351188Z","title":"”Monte Carlo tree search: A review of recent modifications and applications.” Artificial Intelligence Review 56.3 (2023): 2497-2562","venue":null,"work_id":"71629041-3f52-4363-99a0-0da5cc4b9fc4","year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.111345Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:19329b8043b70d0f144274381c3c65c8dc470b630df9c93d33bb7eddd0d333ba","observation_id":"43d36889-2ea1-4806-b25b-77e502231a41","resolution":{"observed_at":"2026-08-15T21:45:35.356588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-18T09:48:11.842015Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-15T21:45:35.115772Z","title":"”Monte carlo tree search boosts reasoning via iterative preference learning.” arXiv preprint arXiv:2405.00451 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.115772Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:40bacd76c2e6a537c5ba60877b983547f88264bcda2e6dfc61b4fe233488f122","observation_id":"ae813dbc-8b2a-44ac-b6b5-de339479dfe9","resolution":{"observed_at":"2026-08-15T21:45:35.115772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.335492Z","title":"”Beyond greedy search: Tracking by multi-agent reinforcement learning-based beam search.” IEEE Transactions on Image Processing 31 (2022): 6239-6254","venue":null,"work_id":"bb879153-ec0d-4313-b6e3-cdd5baa5044b","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.120482Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:3fd3fc93b308c779871c72809ea9cf6e4fc4db2f0c3ac403d98d2b82e3692fd8","observation_id":"0315eb13-f23d-43cc-b771-cc935a2af31d","resolution":{"observed_at":"2026-08-15T21:45:35.341152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.317589Z","title":"”RL Baselines3 Zoo.” GitHub repository (2020)","venue":null,"work_id":"b7d651a0-76a0-4108-be78-e9e7e4f64ad1","year":2020},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.125457Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:dede67b886811a32445ba2c7bfb276d82528dcf0058af27f288c46040d83af05","observation_id":"b68f52c9-d7ec-4cfe-9954-f33d97a001dd","resolution":{"observed_at":"2026-08-15T21:45:35.323678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-15T21:45:35.130093Z","title":"”Openai gym.” arXiv preprint arXiv:1606.01540 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.130093Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:ca8d8a47d4a1e85b19cf77a08157ce583625ddc8c719e8462543644d1ee3cbb5","observation_id":"d34cd3fe-9512-440a-9675-026d56de3c96","resolution":{"observed_at":"2026-08-15T21:45:35.130093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-15T21:45:35.134938Z","title":"”Soft actor-critic algorithms and applica- tions.” arXiv preprint arXiv:1812.05905 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.134938Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:e459aadb7c1b9702c2820f4c0f82a4ce6412190959c9832d4007521bb9677efd","observation_id":"a7f1d474-7272-4cd3-8e9b-0d075b2ae5aa","resolution":{"observed_at":"2026-08-15T21:45:35.134938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09123","last_updated":"2022-05-18T17:58:54Z","snapshot_observed_at":"2026-08-16T16:59:24.144790Z","submitted_at":"2022-05-18T17:58:54Z","title":"A2C is a special case of PPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09123","snapshot_observed_at":"2026-08-15T21:45:35.140853Z","title":"”A2C is a special case of PPO.” arXiv preprint arXiv:2205.09123 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.140853Z"},"links":{"cited_paper":"/paper/2205.09123","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:8a4e59f606dce294f0d55db85af783bff3fd4f50e395f30487085d3d1d06e559","observation_id":"845e944e-000f-4355-ab96-3c7494df062e","resolution":{"observed_at":"2026-08-15T21:45:35.140853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:45:35.146067Z","title":"”Proximal policy optimization algorithms.” arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.146067Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:94760dade3a366d62290f42a5c8f446e94f01cb616656ef0d535583d92f4bb28","observation_id":"6dbc1c6b-53ec-47bd-be34-3cf5cfb4fa7a","resolution":{"observed_at":"2026-08-15T21:45:35.146067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12415","last_updated":"2024-03-19T03:55:39Z","snapshot_observed_at":"2026-08-18T03:50:57.076409Z","submitted_at":"2024-03-19T03:55:39Z","title":"VisionGPT: LLM-Assisted Real-Time Anomaly Detection for Safe Visual Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12415","snapshot_observed_at":"2026-08-15T21:45:35.150536Z","title":"”Visiongpt: Llm-assisted real-time anomaly de- tection for safe visual navigation.” arXiv preprint arXiv:2403.12415 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.150536Z"},"links":{"cited_paper":"/paper/2403.12415","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:16bb3719c359524161831961b852f334f97c2e3d12ce2f97e17884a6ab37bac4","observation_id":"ff361cf6-bfb1-4f83-8c13-456afcea3f27","resolution":{"observed_at":"2026-08-15T21:45:35.150536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T03:51:37.643313Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2505.09029."}