{"as_of":"2026-08-08T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c72001799e148e491289dee7d9724994a67bb9c372d95be6c0fe388d9ecb422","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:25:00.054246Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15306/citation-record","integrity":"/paper/2505.15306/integrity","json":"/paper/2505.15306/citation-record.json","paper":"/paper/2505.15306"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.675215Z","title":"Reinforcement learning: An introduction.A Bradford Book, 2018","venue":null,"work_id":"ead896c9-9773-499a-bcf4-3648c56c5489","year":2018},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.234369Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:d1b6a019bf4d238ea981a0012cf1c2fd74ead1be7c05f987e2b0939d8887d429","observation_id":"7ad5cac9-df3a-44a8-bfda-9bd22a7c4f8b","resolution":{"observed_at":"2026-08-07T15:25:01.681461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.652022Z","title":"An introduction to deep reinforcement learning.Foundations and Trends® in Machine Learning, 11(3-4):219–354, 2018","venue":null,"work_id":"66cdb308-6705-49af-9133-68b05c22825f","year":2018},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.288962Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:2c7adb41b47338b13cd5f627cd7c6d65ac0fe81062c6721fd3bac3a9f9483211","observation_id":"b65d7d72-dd7a-4714-becf-e4a3fe7b93d8","resolution":{"observed_at":"2026-08-07T15:25:01.660069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:56.346937Z","title":"Mastering the game of go without human knowledge.nature, 550(7676):354–359, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.346937Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:87a2f5d2a35c65ef522e00e1d61dc3d36f3cf846bd7ca09cca2eaca31a56c24a","observation_id":"e379d43f-4d11-4265-8313-801cd0839fad","resolution":{"observed_at":"2026-08-07T15:24:56.346937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:56.431165Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning.nature, 575(7782):350–354, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.431165Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:ebcd83df2e9f3309a5e66d5c862cc498e95124b184d08fc2f25447deb8f8bcd4","observation_id":"2db00582-0d4f-4bac-856b-d4dcff09eaab","resolution":{"observed_at":"2026-08-07T15:24:56.431165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T15:24:56.541701Z","title":"Dota 2 with large scale deep reinforcement learning.arXiv preprint arXiv:1912.06680, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.541701Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:38f52a78a389e001cf7a21d190450c98134b4f4ae17d079e2e70e9af8a685ad1","observation_id":"b5c85c06-0d0d-4240-a7f2-d61777df09e3","resolution":{"observed_at":"2026-08-07T15:24:56.541701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.599875Z","title":"Mastering atari games with limited data.Advances in neural information processing systems, 34:25476–25488, 2021","venue":null,"work_id":"620f2823-0358-4e46-9374-f14cf3b7ee33","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.598174Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:b71fa10a10fa596fe683dee83e9e89ca99f4d8af4787f6b0e73ccfc7bbed68ac","observation_id":"eb94c72c-b50b-45d6-98d8-4ab6433b0bf5","resolution":{"observed_at":"2026-08-07T15:25:01.606430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.578907Z","title":"A graph placement methodology for fast chip design.Nature, 594(7862):207–212, 2021","venue":null,"work_id":"b07450d4-bc90-4ca1-9ef9-6836f6cdb249","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.693310Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:742afc7499fcd6ba6b50e92d1f9255b25faffe53c7829db7bae578fa392de2b5","observation_id":"78b34cf3-9b9d-4b81-85d1-48c022f7a2b8","resolution":{"observed_at":"2026-08-07T15:25:01.584564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.552233Z","title":"Hierarchical reinforcement learning for scarce medical resource allocation with imperfect information","venue":null,"work_id":"fde13553-a7f4-486e-b0ea-fb83a4ec9c7e","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.767959Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:e7b4789b1f3cc4882b5f78ed31bd726660b3488dbe19fa5c8190a0f7edb36dab","observation_id":"d14d986c-aa0b-4a88-a7b6-4179af0f8d06","resolution":{"observed_at":"2026-08-07T15:25:01.558171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.533329Z","title":"Reinforcement learning enhances the experts: Large-scale covid-19 vaccine allocation with multi-factor contact network","venue":null,"work_id":"9ba4270f-8399-4a13-bfbb-c0880a5d0d3b","year":2022},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.855259Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:b00f85b45c6d39d2ae912ff47386afb70c7bd93fe9d45651f4880d2667159a2c","observation_id":"99e60500-87cd-4591-81ca-4282dfb822a5","resolution":{"observed_at":"2026-08-07T15:25:01.538975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.515592Z","title":"Gat-mf: Graph attention mean field for very large scale multi-agent reinforcement learning","venue":null,"work_id":"9c4efd01-425d-4e37-abc1-459c6717e799","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.945786Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:0c97c9e108437c256918792fb0b415c3d4e12ca5e53cae19d4a9fbd6d5920c20","observation_id":"f0e78dcd-1a14-4ab8-9db4-436492db1d43","resolution":{"observed_at":"2026-08-07T15:25:01.520522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:57.047385Z","title":"Spatial planning of urban communities via deep reinforcement learning.Nature Computational Science, 3(9):748– 762, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.047385Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:82f286580d259cd2e2bf48f11ff296cd68f8e0b18df867ea3da706048938224e","observation_id":"1638ec47-1810-47be-9ac0-132adbf5f3bb","resolution":{"observed_at":"2026-08-07T15:24:57.047385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.485780Z","title":"A survey of machine learning for urban decision making: Applications in planning, transportation, and healthcare.ACM Computing Surveys, 2024","venue":null,"work_id":"5c1e9bd0-2d12-4cad-b7f4-55fa347eb99f","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.099196Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:4f5fa73337313720989344fc1c225760e89deeba174541a6324d4bd06d72e809","observation_id":"15e054f8-c016-49d9-a301-117d0711c46d","resolution":{"observed_at":"2026-08-07T15:25:01.491251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.466286Z","title":"Dyps: Dynamic parameter sharing in multi-agent reinforcement learning for spatio-temporal resource allocation","venue":null,"work_id":"a021f86f-327f-4539-ba77-ae9dcf8a65d9","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.212195Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:4d409e5820d0e4f446aa3211456cc95a4a094359a8548188e808081f69ab7c25","observation_id":"39339997-605b-4318-bbbf-bfec067c9de8","resolution":{"observed_at":"2026-08-07T15:25:01.471478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.448349Z","title":"Coopride: Cooperate all grids in city-scale ride-hailing dispatching with multi-agent reinforcement learning","venue":null,"work_id":"8492e5b3-01f0-48a9-9598-7ffa3dca8703","year":2025},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.301068Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:2221a78180c63660a306ae413ceb71f31fa541faf8c74e56d840c8cefef6a405","observation_id":"3652024f-61f0-4ba1-b24b-bf63788475f8","resolution":{"observed_at":"2026-08-07T15:25:01.453447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07165","last_updated":"2025-02-04T05:17:26Z","snapshot_observed_at":"2026-07-06T20:04:25.198952Z","submitted_at":"2024-12-10T03:55:18Z","title":"A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07165","snapshot_observed_at":"2026-08-07T15:24:57.402374Z","title":"A method for evaluating hyperparameter sensitivity in reinforcement learning.arXiv preprint arXiv:2412.07165, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.402374Z"},"links":{"cited_paper":"/paper/2412.07165","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:116f4b6a3708444d5a7a75183754ca4ad4a5c02408bbc9c865c0e84cf9961fab","observation_id":"a86bb074-2a9b-47c2-90ba-95720d7c2bec","resolution":{"observed_at":"2026-08-07T15:24:57.402374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08295","last_updated":"2018-07-05T06:50:33Z","snapshot_observed_at":"2026-07-06T06:46:06.112963Z","submitted_at":"2018-06-21T15:39:19Z","title":"How Many Random Seeds? Statistical Power Analysis in Deep Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08295","snapshot_observed_at":"2026-08-07T15:24:57.516895Z","title":"How many random seeds? statistical power analysis in deep reinforcement learning experiments.arXiv preprint arXiv:1806.08295, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.516895Z"},"links":{"cited_paper":"/paper/1806.08295","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:77a910aa1ea1decf0489d90d64c1e3d878fbc43808db8b085761b583992f5eff","observation_id":"52045072-bd79-4cbd-a6a1-4dafc2302c9e","resolution":{"observed_at":"2026-08-07T15:24:57.516895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.432221Z","title":"Ensemble deep learning: A review.Engineering Applications of Artificial Intelligence, 115:105151, 2022","venue":null,"work_id":"b03900c1-9ec5-44af-bcb4-36e4dab41bcd","year":2022},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.614737Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:f1bad238a4f4e43e74ce0dd4438f28f60a0eb3b0662fedd31dd3301037834802","observation_id":"73c5c68b-f8d5-41cd-840a-450a3b80d005","resolution":{"observed_at":"2026-08-07T15:25:01.437638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.416070Z","title":"A survey on ensemble learning.Frontiers of Computer Science, 14:241–258, 2020","venue":null,"work_id":"003e4f6d-0420-4122-a16a-0a3d6cefa0ab","year":2020},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.701960Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:aa60b5dec64b563299bc712cc9b79155dd739907c3bb7390b57862f4ef09bbac","observation_id":"85e2220f-f902-4ad9-a9af-b91f988f89e4","resolution":{"observed_at":"2026-08-07T15:25:01.421082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.400251Z","title":"Ensemble reinforcement learning: A survey.Applied Soft Computing, page 110975, 2023","venue":null,"work_id":"d200903f-a49d-42e2-9564-1c09b254c466","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.775550Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:db1e4685f0643bf9ac50079ae6abd16eb2de82d5c0109b24ed259b48396aa6a9","observation_id":"422ef0c2-f114-4985-bf1d-8e18ca44d06a","resolution":{"observed_at":"2026-08-07T15:25:01.405209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.384889Z","title":"Neural network ensembles in reinforcement learning","venue":null,"work_id":"c5d1e54a-1ec1-48b7-8376-97bbecfaed81","year":2015},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.856542Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:5ce49463bf48cb58ce1f516e0736a0d78df1d54457f6378ac5451136f7725bda","observation_id":"69160df6-5acd-4af3-b01f-1599a827a21e","resolution":{"observed_at":"2026-08-07T15:25:01.389623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08878","last_updated":"2020-08-20T10:40:42Z","snapshot_observed_at":"2026-08-02T02:40:43.081224Z","submitted_at":"2020-08-20T10:40:42Z","title":"Reinforcement Learning based dynamic weighing of Ensemble Models for Time Series Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08878","snapshot_observed_at":"2026-08-07T15:24:57.963590Z","title":"Reinforcement learning based dynamic weighing of ensemble models for time series forecasting.arXiv preprint arXiv:2008.08878, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.963590Z"},"links":{"cited_paper":"/paper/2008.08878","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:9c61861489b2903eea8ba0f125f2f3f286c2225fa49b296ba5ec263c2c6df113","observation_id":"499cc08f-ef3e-4042-b788-fac959861c37","resolution":{"observed_at":"2026-08-07T15:24:57.963590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.369385Z","title":"Ensemble algorithms in reinforcement learning.IEEE Transactions on Systems, Man, and Cybernetics, Part B (Cybernetics), 38(4):930–936, 2008","venue":null,"work_id":"890f2379-d8bf-48f7-9fd8-bf75515a1818","year":2008},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.083139Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:dc7c633b24f756e4447da70ba9eceb764432829e79423c8e9d0336c4ffa9ce57","observation_id":"f5a597ba-0a2c-4a3b-b84f-36281b50f99a","resolution":{"observed_at":"2026-08-07T15:25:01.374081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.353116Z","title":"The arcade learning environment: An evaluation platform for general agents.Journal of Artificial Intelligence Research, 47:253–279, 2013","venue":null,"work_id":"2ad8ea01-72cb-44ed-9e54-8b9bc292557f","year":2013},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.191168Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:61351a835c156a66bf2701b0093a95b0047fc67892d6f0332627e5883795ae28","observation_id":"cc9b4d82-1585-4b67-a68d-64dd57681529","resolution":{"observed_at":"2026-08-07T15:25:01.358572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00374","last_updated":"2024-04-03T14:26:32Z","snapshot_observed_at":"2026-08-07T15:39:37.899352Z","submitted_at":"2019-03-01T15:40:19Z","title":"Model-Based Reinforcement Learning for Atari","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00374","snapshot_observed_at":"2026-08-07T15:24:58.285479Z","title":"Model- based reinforcement learning for atari.arXiv preprint arXiv:1903.00374, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.285479Z"},"links":{"cited_paper":"/paper/1903.00374","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:71bfd968fc4c5b4acbce7c63b6bb692b4d87e3940cef48bc8b9af8544577488b","observation_id":"9e8f1398-449e-4f9f-a24d-73586e8337f3","resolution":{"observed_at":"2026-08-07T15:24:58.285479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:58.360163Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.360163Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:a705167257d328a17cccb49def19d3803e1df1f63e0a4f093035cc486ac6be9d","observation_id":"80b1eed5-579f-40ec-9f56-ebcb17ade291","resolution":{"observed_at":"2026-08-07T15:24:58.360163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.323560Z","title":"A survey of gpt-3 family large language models including chatgpt and gpt-4.Natural Language Processing Journal, page 100048, 2023","venue":null,"work_id":"5f647ae1-3647-4e0b-a697-1fa65f28804d","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.423192Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:dd164002133114c37b765c425ecaa8b1a1de49ff012ebc9fd46a3ffe623682ca","observation_id":"e4ac7fd4-1ae1-47eb-bc30-7a4d805c4141","resolution":{"observed_at":"2026-08-07T15:25:01.330048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:24:58.507475Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.507475Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:71a566bb527eb1fb86e01e112034608a0b9d71a60585b57f6058cef22f2eb8aa","observation_id":"2cec5757-1406-40ba-8e63-a0a23a7a4af5","resolution":{"observed_at":"2026-08-07T15:24:58.507475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:58.596746Z","title":"Evaluation of openai o1: Opportunities and challenges of agi.arXiv preprint arXiv:2409.18486, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.596746Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:2e4e2b8f05352ff8d6c653d939d55615039dbebf67cd0ff724f34b64f58634f9","observation_id":"9ed98770-0f4d-4d91-a149-51d27d2c74ac","resolution":{"observed_at":"2026-08-07T15:24:58.596746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:58.719213Z","title":"Early access for safety testing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.719213Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:228e127c3d8aef181a99b4f8b93866de9826582d12dd0419b4955242a4824cfd","observation_id":"0bd3492f-c5fb-4285-91ba-dc3f233a93e9","resolution":{"observed_at":"2026-08-07T15:24:58.719213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:24:58.773436Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.773436Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:3e482b755216f2218a8e5f09afeae4474b98a4c80cd12e70d67926b3dac0cc4a","observation_id":"7e419586-5f54-4b2f-97a6-d767d7a28875","resolution":{"observed_at":"2026-08-07T15:24:58.773436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:24:58.858777Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.858777Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:a93c6f583dfdb0e4707c16ec520bbab3e9b9255b52dcfdba111dc407098480f0","observation_id":"81c4a7cd-d620-47d9-aa37-efa2acf441b9","resolution":{"observed_at":"2026-08-07T15:24:58.858777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.288720Z","title":"Palm: Scaling language modeling with pathways.Journal of Machine Learning Research, 24(240):1– 113, 2023","venue":null,"work_id":"385ee358-4fdf-407e-9aa0-13f68ccab130","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.905319Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:cb8e5e81148d044e71f6ada0cf142460e1a7b0dc44eae0647de7a218aff23cc6","observation_id":"e50db835-66ed-4bc0-be9d-8dd885ffb078","resolution":{"observed_at":"2026-08-07T15:25:01.296489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09112","last_updated":"2024-10-10T10:46:06Z","snapshot_observed_at":"2026-07-06T19:32:02.130965Z","submitted_at":"2024-10-10T10:46:06Z","title":"HLM-Cite: Hybrid Language Model Workflow for Text-based Scientific Citation Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09112","snapshot_observed_at":"2026-08-07T15:24:58.977041Z","title":"Hlm-cite: Hybrid language model workflow for text-based scientific citation prediction.arXiv preprint arXiv:2410.09112, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.977041Z"},"links":{"cited_paper":"/paper/2410.09112","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:10cd916de11406ad2ccb9e073916ac765265c0e593c363567eb2e2bef6b44c90","observation_id":"75835048-2848-449e-b468-48470fc8d4d8","resolution":{"observed_at":"2026-08-07T15:24:58.977041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.269075Z","title":"Stance detection with collaborative role-infused llm-based agents","venue":null,"work_id":"5a9ba110-7f2b-45b1-9bfa-08bb5eda9435","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.013226Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:cadbded637ceaabe8baf5ab7c82c9a329165e6d07da8a5ede2cdfce7a0ca85ed","observation_id":"208f9e6d-4ddf-402e-904d-6970c1895359","resolution":{"observed_at":"2026-08-07T15:25:01.274908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T15:24:59.120276Z","title":"A survey of large language models.arXiv preprint arXiv:2303.18223, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.120276Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:5e1a6e6f363a551b140d3fbefd6cd7841cc2d223c19cb72d43d977522fcfb98c","observation_id":"9c59abd1-1c3a-417f-917f-fa74e16f8d15","resolution":{"observed_at":"2026-08-07T15:24:59.120276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:59.187554Z","title":"A survey on evaluation of large language models.ACM Transactions on Intelligent Systems and Technology, 15(3):1–45, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.187554Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:24a75cafa6fc12a99272b45a3de1784b1f97dfd57afdf9dc2fec60be39c2b27b","observation_id":"2b89717b-1b06-4ca5-a502-4431b39f1141","resolution":{"observed_at":"2026-08-07T15:24:59.187554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T15:24:59.239623Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models.arXiv preprint arXiv:2501.09686, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.239623Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:cf9d7f7ec6dabd5bbb50e11282020bfe5543b16cc475c2c86fbf1c2b46c5c700","observation_id":"5e1fc835-6489-454b-9871-983b131ae05f","resolution":{"observed_at":"2026-08-07T15:24:59.239623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:59.336489Z","title":"Human-level control through deep reinforcement learning.Nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.336489Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:661c8b33ba9b201ee852a0e174e081c3c414f42bfe6adf29dbd19f9187087c6c","observation_id":"0feaeef7-b1aa-4336-a23b-c0835c105e9f","resolution":{"observed_at":"2026-08-07T15:24:59.336489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.214636Z","title":"Deep reinforcement learning based ensemble model for rumor tracking.Information Systems, 103:101772, 2022","venue":null,"work_id":"e3ddd6d5-eb35-4425-9c60-9e8e9f0d137b","year":2022},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.406512Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:7e6244b0dafbd5d0936d7e7f6186c949677466620b81a58b5a44fd48db8cb9bc","observation_id":"64033e28-5714-48c8-ba06-23aa04f9f757","resolution":{"observed_at":"2026-08-07T15:25:01.226796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.103105Z","title":"An oppositional-cauchy based gsk evolutionary algorithm with a novel deep ensemble reinforcement learning strategy for covid-19 diagnosis.Applied Soft Computing, 111:107675, 2021","venue":null,"work_id":"acb446ba-6d28-42c8-8899-2a1518e256b7","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.516768Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:1a88faf930bfe96b8a16087d42db9f837bbc30de4cba55ec9d823a6e34ffb50d","observation_id":"af3c0484-5644-417c-9949-b2722bfb93fe","resolution":{"observed_at":"2026-08-07T15:25:01.179323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00282","last_updated":"2024-10-30T02:22:46Z","snapshot_observed_at":"2026-07-06T17:53:23.188198Z","submitted_at":"2024-03-30T08:28:08Z","title":"Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00282","snapshot_observed_at":"2026-08-07T15:24:59.577571Z","title":"Survey on large language model-enhanced reinforcement learning: Concept, taxonomy, and methods.arXiv preprint arXiv:2404.00282, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.577571Z"},"links":{"cited_paper":"/paper/2404.00282","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:24022781815c23696161e8217b816c5ad7615e05cb887774e96ce07277bbb968","observation_id":"fe683cb7-9a2a-4882-8a66-49e4a15e6b1d","resolution":{"observed_at":"2026-08-07T15:24:59.577571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.017497Z","title":"Augmenting autotelic agents with large language models","venue":null,"work_id":"18699445-5e67-4d6f-839e-326b0441f479","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.675486Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:d77d121185dddd8052588f2555a3b70a818d8a2d86b0db10748b967cd78acbab","observation_id":"d068ec1c-548d-4d1b-8f5e-9195ddd2e1f5","resolution":{"observed_at":"2026-08-07T15:25:01.080388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:00.739542Z","title":"Read and reap the rewards: Learning to play atari with the help of instruction manuals.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"1ad73d04-774d-4cd7-836e-4d3439cdf4dc","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.806577Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:7752fd0347c4cdd696a1931dc6a5f0c09bdad5a026c57f02b48f7d947ff41224","observation_id":"5674d13e-b4ba-43fb-b7cc-48b26df7d801","resolution":{"observed_at":"2026-08-07T15:25:00.823614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06687","last_updated":"2023-10-02T17:20:21Z","snapshot_observed_at":"2026-08-03T23:49:55.520138Z","submitted_at":"2023-09-13T02:56:56Z","title":"Self-Refined Large Language Model as Automated Reward Function Designer for Deep Reinforcement Learning in Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06687","snapshot_observed_at":"2026-08-07T15:24:59.961027Z","title":"Self-refined large language model as automated reward function designer for deep reinforcement learning in robotics.arXiv preprint arXiv:2309.06687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.961027Z"},"links":{"cited_paper":"/paper/2309.06687","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:f8a589e0895f5fd55b3c7e528d7bbfc0c4133623a7b138fe52a0bfee08ec7354","observation_id":"1bfd96f7-721e-46bc-821e-f6528fd842e8","resolution":{"observed_at":"2026-08-07T15:24:59.961027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:00.583439Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":"37e6ad0d-2fd9-4932-8fc6-122def7661a0","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.040054Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:75fd331ba280f27fd183dd2b456a9082adb79b3ef6a0dd2a884e6cf7d02884da","observation_id":"e6e1b00b-aa8c-4a42-a3a7-d870bb862034","resolution":{"observed_at":"2026-08-07T15:25:00.632744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13237","last_updated":"2024-07-18T07:47:51Z","snapshot_observed_at":"2026-07-06T18:48:16.629078Z","submitted_at":"2024-07-18T07:47:51Z","title":"LLM-Empowered State Representation for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13237","snapshot_observed_at":"2026-08-07T15:25:00.044677Z","title":"Llm-empowered state representation for reinforcement learning.arXiv preprint arXiv:2407.13237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.044677Z"},"links":{"cited_paper":"/paper/2407.13237","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:41b86b39b73bd1c18c7f7ab825c06044eb9656b13b14559dce0fefa8beb52d0b","observation_id":"61197aeb-f728-4ac8-bfb1-da8bba5d30b2","resolution":{"observed_at":"2026-08-07T15:25:00.044677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-07T15:25:00.049554Z","title":"Large language model as a policy teacher for training reinforcement learning agents.arXiv preprint arXiv:2311.13373, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.049554Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:9471c874c1020fd9139628724724d51e2f86b633e73d93415f3466de0f58a32f","observation_id":"dcc67497-61f2-4cda-bb79-433cc4f087b4","resolution":{"observed_at":"2026-08-07T15:25:00.049554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:00.467468Z","title":"Exploration Situation","venue":null,"work_id":"34e87000-0802-4f03-9ea9-42521da3895e","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.054246Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:dfe641038d85b6405101261770a9ff95ad77506c1764b5221283e9f2caff2df5","observation_id":"b0b4ac66-6707-458b-a5e8-9cec8977cf8d","resolution":{"observed_at":"2026-08-07T15:25:00.520873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2505.15306."}