{"as_of":"2026-08-09T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:318a382c0ab43a53081135ca465fbec597e538fd526933c79da8246dacfe38b7","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:36:02.619219Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06053/citation-record","integrity":"/paper/2509.06053/integrity","json":"/paper/2509.06053/citation-record.json","paper":"/paper/2509.06053"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:01.718482Z","title":"Reinforcement learning in robotics: A survey.The International Journal of Robotics Research, 32(11):1238–1274, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.718482Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:10fd209c38e0ad7b731ad19953793a882b578e0c928ec14a8cbc8f8ecd01fb9c","observation_id":"76069711-87f4-4052-8c95-f8b4ad411aac","resolution":{"observed_at":"2026-08-05T04:36:01.718482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.878866Z","title":"Sim-to-real robot learning from pixels with progressive nets","venue":null,"work_id":"f50a7396-d23c-4554-8b4b-3a31d56bb053","year":2017},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.757271Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:2112099d72db501ebb4e39bd2eea223707bf779003f35a9731851be64cdafcfd","observation_id":"8adbcd51-4595-448a-a98f-249794217e54","resolution":{"observed_at":"2026-08-05T04:36:03.881420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.871064Z","title":"Google research football: A novel reinforcement learning environment","venue":null,"work_id":"27670ca4-da76-421d-a7d2-0266c7992fc5","year":2020},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.838723Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:bf69938bb2dbd8527b1bac6cea7310df87f1cbdf1359bc91d821792f86c5a936","observation_id":"a4d57b60-a009-40e3-86e1-db4827171bc6","resolution":{"observed_at":"2026-08-05T04:36:03.873689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.863508Z","title":"A comprehensive review of multi-agent reinforcement learning in video games.IEEE Transactions on Games, 2025","venue":null,"work_id":"fe04c411-9fc9-4433-86b0-d8f6f4f6a770","year":2025},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.932070Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:c103ec5d66d6e4285ddbb958a56fc802406bae41d159a37ede1234bde9c08e94","observation_id":"60035789-2acb-46d4-939c-dc77ac2ab32a","resolution":{"observed_at":"2026-08-05T04:36:03.866070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.855979Z","title":"Robustness and sample complexity of model-based marl for general-sum markov games.Dynamic Games and Applications, 13(1):56–88, 2023","venue":null,"work_id":"d2a002c1-4672-489f-a150-760b85fcb6a0","year":2023},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.986521Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:7e6ff18e22516feaab578df8471514a5fe30c49a4c54b38921c05f10fe7c76b3","observation_id":"7aa75364-9c6c-42ee-89bc-0c6262147ced","resolution":{"observed_at":"2026-08-05T04:36:03.858739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.848157Z","title":"Multi-agent reinforcement learning for autonomous driving: A survey.CoRR, 2024","venue":null,"work_id":"c77c7db4-c1a8-4a5d-bcbc-adcfb75958c3","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.046727Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:89f634cb48ec952035987eb7d69c8f53d53ad391dd0c37d6c077021ca7795008","observation_id":"d96436a9-e1dc-4079-80a9-0716bb5a3cd9","resolution":{"observed_at":"2026-08-05T04:36:03.850909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:02.077841Z","title":"Deep reinforcement learning for autonomous driving: A survey.IEEE transactions on intelligent transportation systems, 23(6):4909–4926, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.077841Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:9b08a3e64c6f48cf559cd16733a78615b6c94539d7dedbe0481064658f3f9aa5","observation_id":"cfcdfffe-0dfd-4d28-8cba-ca5f3d0de4ed","resolution":{"observed_at":"2026-08-05T04:36:02.077841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.08844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.014980Z","title":"Equilibrium selection for multi-agent reinforcement learning: A unified framework.arXiv preprint arXiv:2406.08844, 2024","venue":null,"work_id":"352eda20-a6fa-4a93-af99-fc9ba1c9cd05","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.132762Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:ce219004a667842cab22de3b3c4b1a069a360f538fa6227175dde7bd786374b1","observation_id":"9825a211-cfb7-454e-98c8-5c2db3c02ff8","resolution":{"observed_at":"2026-08-05T04:36:03.079984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.835144Z","title":"Emergent reciprocity and team formation from randomized uncertain social preferences.Advances in neural information processing systems, 33:15786–15799, 2020","venue":null,"work_id":"41b50c79-4f59-40e5-970c-c799f1446bfa","year":2020},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.184973Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:e357cfed8142fe92cce1c410719852a9cd81dc000506045b09029dccd5c46f72","observation_id":"9987f2c2-1689-4a8e-8760-18d0312108a2","resolution":{"observed_at":"2026-08-05T04:36:03.837935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.718867Z","title":"Taxai: A dynamic economic simulator and benchmark for multi-agent reinforcement learning","venue":null,"work_id":"606684d6-f360-4ce9-a398-9220a621187f","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.269117Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:1687a6908b9fb9cc0fe0e12ba5119aa2d842cfca9ff926621cbf2da49b499747","observation_id":"32ae72e4-5c42-4870-9f13-c7450bd67df1","resolution":{"observed_at":"2026-08-05T04:36:03.772790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.603183Z","title":"A new approach to solving smac task: Generating decision tree code from large language models.arXiv e-prints, pages arXiv–2410, 2024","venue":null,"work_id":"0262a3e3-690e-42d4-8f30-714b50aea03e","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.321874Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:6580b32fee3e36d5f4129985a537a93352cc702447d9dc0817317269b4d3ea89","observation_id":"eb2d90d7-842f-419e-8e66-3481a3a2bc57","resolution":{"observed_at":"2026-08-05T04:36:03.676990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14299","last_updated":"2025-06-17T08:18:20Z","snapshot_observed_at":"2026-08-07T00:15:43.817194Z","submitted_at":"2025-06-17T08:18:20Z","title":"ADRD: LLM-Driven Autonomous Driving Based on Rule-based Decision Systems","version":1},"cited_work":{"arxiv_id":"2506.14299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14299","snapshot_observed_at":"2026-08-05T04:36:02.697356Z","title":"ADRD: LLM-Driven Autonomous Driving Based on Rule-based Decision Systems","venue":"cs.AI","work_id":"20ee3b3c-f83d-42ed-8b30-d2268a02e922","year":2025},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.379064Z"},"links":{"cited_paper":"/paper/2506.14299","citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:88af3822655c7eb1e5a142b8b150babf8aa2a7238188a55cb4adb7085b9ed7a5","observation_id":"fee254cb-faf1-426e-88f5-9317392408f4","resolution":{"observed_at":"2026-08-05T04:36:02.769162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.411513Z","title":"Language models speed up local search for finding programmatic policies.Transactions on Machine Learning Research, 20(X), 2024","venue":null,"work_id":"748e0b7f-7580-4d8c-bbee-1a904d6f8ad9","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.461787Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:12a9d739e8e61ed97cc33a4d503b6176d92426747be7a40f9589fa867156cfaa","observation_id":"9929797c-8d60-4e4f-b4bb-40cab986b4bd","resolution":{"observed_at":"2026-08-05T04:36:03.500218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.259975Z","title":"Synthesizing programmatic reinforcement learning policies with large language model guided search","venue":null,"work_id":"a0d031b6-b19e-4b99-9cbc-c6a76a229aa9","year":null},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.507355Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:db3deaccbfd32424293c933ef04b5f0e69a0eac8d0fd4efbd9e36b46bb684604","observation_id":"55979992-ad1f-4405-abe3-e55b1f3cd0d8","resolution":{"observed_at":"2026-08-05T04:36:03.328505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:02.563015Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.563015Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:f2e357acbb587697a6edac5c579d95556e49a304dbf8d897e09c6cea13b0c846","observation_id":"8af0bf21-4f54-4731-88bc-7bfe7d8d2ad2","resolution":{"observed_at":"2026-08-05T04:36:02.563015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.146763Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"de4e584c-3aed-4450-8031-f7c808e1da89","year":2023},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.619219Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:4261a7da350199063252a4d0849f9bcd3f56385649e36e4bc78ecd74eec757a3","observation_id":"261bd7e9-b332-4bd3-b498-d0d70c55ef7a","resolution":{"observed_at":"2026-08-05T04:36:03.210132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T04:36:01.299054Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2509.06053."}