{"as_of":"2026-08-09T00:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e8fabc0c531e42ac8a9e8416f922d92958b4d531150dff3eb201a55f73e6cf7","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:43:29.945895Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:15:06.694233Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-06T20:54:47.861802Z","title":"Evolution strategies at scale: Llm fine-tuning beyond reinforcement learning.arXiv preprint arXiv:2509.24372, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01752","last_updated":"2026-06-23T13:09:44Z","snapshot_observed_at":"2026-08-06T20:41:02.833387Z","submitted_at":"2025-07-02T14:29:30Z","title":"Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:54:47.861802Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2507.01752"},"observation_digest":"sha256:70b61f06483d4cbb924a46d46b3d35eec4a51856626a8de92a68c93951f2490f","observation_id":"08cfb055-de24-4a25-92bc-b230408cc6d1","resolution":{"observed_at":"2026-08-06T20:54:47.861802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2509.24372","doi":"10.48550/arxiv.2509.24372","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evolution strategies at scale: Llm fine-tuning beyond reinforcement learning","venue":"arXiv (Cornell University)","work_id":"81c2a6be-1c1c-4174-8d58-0252a694a514","year":2025},"citing_paper":{"arxiv_id":"2602.01003","last_updated":"2026-05-08T02:41:03Z","snapshot_observed_at":"2026-08-06T13:33:14.760805Z","submitted_at":"2026-02-01T03:56:08Z","title":"ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:04.873255Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2602.01003"},"observation_digest":"sha256:e52dd7275abab3963673dbc26d54265dfe29aac35c95b939b1ddb82a0a964c39","observation_id":"d7d77328-35f2-43e4-a15a-13a73d071b8f","resolution":{"observed_at":"2026-07-15T02:21:57.501664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2509.24372","doi":"10.48550/arxiv.2509.24372","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evolution strategies at scale: Llm fine-tuning beyond reinforcement learning","venue":"arXiv (Cornell University)","work_id":"81c2a6be-1c1c-4174-8d58-0252a694a514","year":2025},"citing_paper":{"arxiv_id":"2605.16345","last_updated":"2026-05-08T01:55:40Z","snapshot_observed_at":"2026-08-03T04:40:04.617513Z","submitted_at":"2026-05-08T01:55:40Z","title":"Goal-Conditioned Supervised Learning for LLM Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:37:46.345159Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2605.16345"},"observation_digest":"sha256:0c24f51646b576cd4baf7c5e368715f895f9cb9bf890823c15e69364423603f0","observation_id":"c079d1a8-4bcd-4cf5-b57b-8adc4393a860","resolution":{"observed_at":"2026-07-15T02:21:57.501664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2509.24372","doi":"10.48550/arxiv.2509.24372","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evolution strategies at scale: Llm fine-tuning beyond reinforcement learning","venue":"arXiv (Cornell University)","work_id":"81c2a6be-1c1c-4174-8d58-0252a694a514","year":2025},"citing_paper":{"arxiv_id":"2605.16727","last_updated":"2026-05-16T00:29:35Z","snapshot_observed_at":"2026-08-01T05:36:54.753419Z","submitted_at":"2026-05-16T00:29:35Z","title":"PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-19T21:37:56.570173Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2605.16727"},"observation_digest":"sha256:92b64619ac984bae6a18a41dac978ccc50ead92aa821c1cd62f4e93448cdef17","observation_id":"4dbd30cf-5d48-4e6f-9b4f-3bcbc479737f","resolution":{"observed_at":"2026-07-15T02:21:57.501664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2509.24372","doi":"10.48550/arxiv.2509.24372","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evolution strategies at scale: Llm fine-tuning beyond reinforcement learning","venue":"arXiv (Cornell University)","work_id":"81c2a6be-1c1c-4174-8d58-0252a694a514","year":2025},"citing_paper":{"arxiv_id":"2606.12279","last_updated":"2026-06-10T16:18:36Z","snapshot_observed_at":"2026-07-06T23:51:13.191639Z","submitted_at":"2026-06-10T16:18:36Z","title":"Mathematical perspective on genetic algorithms with optimization guided operators","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T07:34:35.422699Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2606.12279"},"observation_digest":"sha256:7246f2c036e0c4af67b7452bee4bd53a1a146ee65a6099b0a247ff1553c3a3e1","observation_id":"124a61b3-fdbf-48b9-b17a-ef78c1143029","resolution":{"observed_at":"2026-07-15T02:21:57.501664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2509.24372","doi":"10.48550/arxiv.2509.24372","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evolution strategies at scale: Llm fine-tuning beyond reinforcement learning","venue":"arXiv (Cornell University)","work_id":"81c2a6be-1c1c-4174-8d58-0252a694a514","year":2025},"citing_paper":{"arxiv_id":"2606.30619","last_updated":"2026-06-29T17:52:23Z","snapshot_observed_at":"2026-08-08T02:17:49.979499Z","submitted_at":"2026-06-29T17:52:23Z","title":"Why can genetic algorithms work in high-dimensional search spaces?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T03:11:04.083187Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2606.30619"},"observation_digest":"sha256:9f49dafbed08c8f166b9a429762edac2b9eb2232b0832acbfefc86c8734a6d5f","observation_id":"56bb7a7c-7b55-4bf2-ba20-fa69215bdf9f","resolution":{"observed_at":"2026-07-15T02:21:57.501664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:04.527605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-02T08:15:19.856120Z","title":"Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Mey- erson, Babak Hodjat, and Risto Miikkulainen","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.856120Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:77c97af9956de7a02e7ec3e8f76c9cfda81a02d9109bc1a4baa5dfdef66ad1ed","observation_id":"1fa9f782-49b7-4896-a4c0-e3fef6f00255","resolution":{"observed_at":"2026-08-02T08:15:19.856120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-08T11:15:06.694233Z","title":"arXiv preprint arXiv:2509.24372 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05541","last_updated":"2026-08-06T02:39:10Z","snapshot_observed_at":"2026-08-09T00:10:44.691704Z","submitted_at":"2026-08-06T02:39:10Z","title":"Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T11:15:06.694233Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2608.05541"},"observation_digest":"sha256:13d3cfdc5d4d5dcf9933710180e61e0b48afba53ef729ca5cf9c8634311ed2ec","observation_id":"a9361b78-916d-42e4-ab8c-c08c8c56e984","resolution":{"observed_at":"2026-08-08T11:15:06.694233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.24372/citation-record","integrity":"/paper/2509.24372/integrity","json":"/paper/2509.24372/citation-record.json","paper":"/paper/2509.24372"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T14:43:16.944824Z","title":"GPT -4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:16.944824Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:7d24073f42bd22e31dda36c53267a71485b459c49f25812a7910d347dbab3f0b","observation_id":"ffed6561-48be-4931-a9be-ae1b5c170ceb","resolution":{"observed_at":"2026-08-04T14:43:16.944824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-lon","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:27.570899Z","title":"Intrinsic dimensionality explains the effectiveness of language model fine-tuning","venue":null,"work_id":"91c6c84d-bb02-4997-bdfb-16c0600edd5e","year":2021},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.104745Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:a170d499cd439888e76a7b6bd2ae057dfc121113950bdb2c9d0ac915000e2e66","observation_id":"4a2b85df-7f2a-42e6-a1c6-84f78c69bb68","resolution":{"observed_at":"2026-08-04T14:43:27.589291Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:17.244748Z","title":"Llama 3 model card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.244748Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:74ea30ed189accc565c9c95e91fa439fd815ca234c9cc318f7dbaf6066cb24de","observation_id":"d92eb794-c4cf-461a-887c-578877622de4","resolution":{"observed_at":"2026-08-04T14:43:17.244748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:17.443331Z","title":"Evolutionary optimization of model merging recipes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.443331Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:927deabb20974bb71080b8b0a5e6cfe03577e89a728d497c28becd5ca5cec5cb","observation_id":"70bbafff-d02b-452a-989e-25dfb20a7668","resolution":{"observed_at":"2026-08-04T14:43:17.443331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:17.695291Z","title":"Introducing Claude 4, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.695291Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:1f0172a6d5688650246ee17952cc41e7d5c251c98c0348d6fd87693c704f3fe4","observation_id":"1cf56819-0c16-469d-a314-258c68a9f53b","resolution":{"observed_at":"2026-08-04T14:43:17.695291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T14:43:17.934749Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:17.934749Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:d86d9b9ae497dac7ccdc155a5ca2566380e48ac5f5cb7f44e910d8c1fd4aad19","observation_id":"a775b486-7838-497b-bbfe-946235b2934d","resolution":{"observed_at":"2026-08-04T14:43:17.934749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.060517Z","title":"Understanding pre-training and fine-tuning from loss landscape perspectives","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.060517Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:e8f0b0498a79842bbaf4a6f906a38a72122d27d88a184dee75b7eeab2069d342","observation_id":"debbf38d-33ca-4e10-aaa2-9c6cfd9ecb91","resolution":{"observed_at":"2026-08-04T14:43:18.060517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.304745Z","title":"On the weaknesses of reinforcement learning for neural machine translation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.304745Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:425f5d09063cf0bd05f4fb3d42cfa7e7d09af4d20f13236c2dc8feb5130c2ea0","observation_id":"40e0d99b-048c-4be0-af24-9cac8f899fea","resolution":{"observed_at":"2026-08-04T14:43:18.304745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.515288Z","title":"Back to basics: benchmarking canonical evolution strategies for playing atari","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.515288Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:279384fe4a6d6b80584851cb2cf21234239e815ecca7c97eb237416d07fb3eca","observation_id":"1448cc4e-5477-4bc3-98e4-0d327e955730","resolution":{"observed_at":"2026-08-04T14:43:18.515288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:18.684764Z","title":"Improving exploration in evolution strategies for deep reinforcement learning via a population of novelty-seeking agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.684764Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:531edae2ee011bf941ab0f106ed47b9cece16fb37cf21ec5e5359d164d180968","observation_id":"ccda3c47-12d6-4009-a746-794a5dffbac2","resolution":{"observed_at":"2026-08-04T14:43:18.684764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-04T14:43:18.815282Z","title":"Bowman, Ethan Perez, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.815282Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:b05f21f6cc1b0230e081fe1875d620484868203f3393972b981adb36f730b21b","observation_id":"b1cadf89-8871-4d75-9cd2-ec44aed1fb11","resolution":{"observed_at":"2026-08-04T14:43:18.815282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.698","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Knowledge fusion by evolving weights of language models","venue":null,"work_id":"e49bd0c1-b929-4cf0-859f-086c64a21506","year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:18.912503Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:fa51127bc4f851dffc75ceb312e942328837983ed0545a2c3a94a041fcac7c12","observation_id":"116f2248-7d3d-4cfb-b0cd-7c9ff0d9f382","resolution":{"observed_at":"2026-08-04T14:43:27.258406Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:19.144753Z","title":"Detecting hallucinations in large language models using semantic entropy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.144753Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:9360bf3e2fa35b59b58b9d1b9080248cebf594aefcd88c84e1904b91a2f876c2","observation_id":"b97881ce-5a75-415f-b8b7-f4646c3872b1","resolution":{"observed_at":"2026-08-04T14:43:19.144753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:19.404754Z","title":"Reward shaping to mitigate reward hacking in RLHF","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.404754Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:ebcd821556974edd5569dfe948b3c8306a37b5d05887c34ffae244dc05091278","observation_id":"97dabea9-1298-426d-8912-3e57462f0dc7","resolution":{"observed_at":"2026-08-04T14:43:19.404754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:19.604788Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective ST ars","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.604788Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:fc17009bc30a57efd0c3cd9620e1a6c378e849be6e61b3a3819f0da622c91987","observation_id":"ef754ffa-0924-4677-9409-758a7b7867d4","resolution":{"observed_at":"2026-08-04T14:43:19.604788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:19.857855Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:19.857855Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:3da45028a472a052ae304442561095fda2bce3e29a3ca9a039fd22f6f3d726f2","observation_id":"1cbe0367-b8b7-4903-a123-a226527c892b","resolution":{"observed_at":"2026-08-04T14:43:19.857855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.014401Z","title":"Deep learning, volume 1","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.014401Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:c4038c6c41f02f2a1115b344919ebdef945cd79b15482951baee22d0d995e146","observation_id":"289e40bd-8b2f-428e-afed-01bc37e65ae0","resolution":{"observed_at":"2026-08-04T14:43:20.014401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.204798Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities., 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.204798Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:7e0275f818422faa6510e47d46c58c5f107857c6d2c14d97382545208e705669","observation_id":"2178f773-8149-4329-991e-b487a03a513f","resolution":{"observed_at":"2026-08-04T14:43:20.204798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T14:43:20.390576Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.390576Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:1de263f2fdffc4c89d3a99c6246b82c9c9330748b503253e49d0aa76615aa551","observation_id":"d62c2a83-2353-42b8-a766-2c584ced21d5","resolution":{"observed_at":"2026-08-04T14:43:20.390576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:20.764759Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:20.764759Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:ebe0c49f85cb15b818352273f49b79e1eae51407b1acb9853d8c80f5fa2946cf","observation_id":"a7036ecf-177d-481a-a876-e664d29aaf9b","resolution":{"observed_at":"2026-08-04T14:43:20.764759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:21.051034Z","title":"Connecting large language models with evolutionary algorithms yields powerful prompt optimizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.051034Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:abb9484e0c9f803352006ee66de20796c6fc339c2261999f53927a356afe7d67","observation_id":"ea0ae0a5-8475-4dfd-a79d-d2757b03ddaf","resolution":{"observed_at":"2026-08-04T14:43:21.051034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:21.314845Z","title":"Completely derandomized self-adaptation in evolution strategies","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.314845Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:e018c378822891fd7ddd234b0c168e099f185248aa615b0647b91699548aa6a5","observation_id":"1dba326f-0240-4c76-9f03-f8b5a2b7d07f","resolution":{"observed_at":"2026-08-04T14:43:21.314845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:21.479943Z","title":"When evolution strategy meets language models tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.479943Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:77f4e173ea3fc58b508c423cbef06515f200ac6c3c6d83fcc9e8cc5860dc7873","observation_id":"18b5cfba-bd1e-4db9-b35f-19b29e9e4410","resolution":{"observed_at":"2026-08-04T14:43:21.479943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:21.755222Z","title":"Neuroevolution for reinforcement learning using evolution strategies","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.755222Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:bc9f1438a459ec672014060c66fc91dbf212f69892573257ecb0bfbe669397db","observation_id":"9e173aea-9f86-4c5d-9ce1-329aff70b79b","resolution":{"observed_at":"2026-08-04T14:43:21.755222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:21.904752Z","title":"Do we need to verify step by step? rethinking process supervision from a theoretical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:21.904752Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:2332b033f754f7f59e6c321198b835e8b59891e85a03d65d5a2b3a70083c265c","observation_id":"66a764d1-4096-4b16-ac11-46cd21524b4a","resolution":{"observed_at":"2026-08-04T14:43:21.904752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-04T14:43:22.124747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:22.124747Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:787e9b709474a33415f0366ad6711f401d623062b4cb21743e8044deda285f63","observation_id":"ec6ea8c0-8122-4c0d-ab22-977bbb2993b4","resolution":{"observed_at":"2026-08-04T14:43:22.124747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:22.334749Z","title":"Derivative-free optimization for low-rank adaptation in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:22.334749Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:3141d51fd2a3d5f683fc0cf5957aed032b4f244b8a24cab81592b0defcd92ca7","observation_id":"b00a1de9-0509-45d4-888f-42b39fc7ed0e","resolution":{"observed_at":"2026-08-04T14:43:22.334749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-04T14:43:22.504761Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:22.504761Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:5ac59253fe26d6863fa9da081b8b38fd526a324e2973b864b748f535c7ffb7c1","observation_id":"2bb53075-2a59-4fca-b33f-64d302e00a34","resolution":{"observed_at":"2026-08-04T14:43:22.504761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:22.674753Z","title":"Fine-tuning chatgpt for automatic scoring","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:22.674753Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:c30229c5b3410c938187663047ae5a65979d5a1efe017d05f74fb33ebd756e0c","observation_id":"ecbb5529-880d-4d57-98c6-d33f02e7a269","resolution":{"observed_at":"2026-08-04T14:43:22.674753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:22.920603Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:22.920603Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:518e634593a9a3005344602f475b9a4d182afa61fe2286cb9f7f21866aeebe7e","observation_id":"26c35849-849e-4738-9715-b2b353ed2dc9","resolution":{"observed_at":"2026-08-04T14:43:22.920603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:23.084747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.084747Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:3d3986a2a6a11c29d595c82431d7132faf47e93d7a88584b5fb76caa0b7f16b8","observation_id":"955ec27f-6a47-4a9f-bf3d-64b382b1f973","resolution":{"observed_at":"2026-08-04T14:43:23.084747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T14:43:23.187732Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.187732Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:29ff8c4759429ff3c653d55bbe11107ee1ff8c6dc6b803aa51536d7c762c01bb","observation_id":"3ee762dd-3f1a-4278-b0a8-5ac1b622d931","resolution":{"observed_at":"2026-08-04T14:43:23.187732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:23.344787Z","title":"Sparse me ZO : Less parameters for better performance in zeroth-order LLM fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.344787Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:37c6a9a98635b98181dc68c5cca59e6d97aea3f9d46386f8e1427a15b9dd4eee","observation_id":"71fa5a7d-e6e4-49a7-8ff6-bf5646c24d07","resolution":{"observed_at":"2026-08-04T14:43:23.344787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13883","last_updated":"2025-07-30T17:37:43Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T17:56:40Z","title":"Utilizing Evolution Strategies to Train Transformers in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13883","snapshot_observed_at":"2026-08-04T14:43:23.484928Z","title":"Utilizing evolution strategies to train transformers in reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.484928Z"},"links":{"cited_paper":"/paper/2501.13883","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:b0011af1d43df34be9000bd754ee715b2dc6e4a3466988eaaa94c8d3d5c7b5fc","observation_id":"efa07711-73e6-4449-971f-3fdcc02cff0b","resolution":{"observed_at":"2026-08-04T14:43:23.484928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:23.574795Z","title":"Fine-tuning language models with just forward passes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.574795Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:f4ad5f6d636d14a222b38e01c8dc4c1f67a66db26c582cdd464a54a5b1d985d0","observation_id":"c5df2399-1981-44ba-968f-11fd4aadbd6c","resolution":{"observed_at":"2026-08-04T14:43:23.574795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:23.664754Z","title":"Nelson, Herbie Bradley, Adam Gaier, Arash Moradi, Amy K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.664754Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:678c605e1ff5056ea8ab2e4e1d3891c2aec6ccaf4090fefff77aaea8757d7860","observation_id":"a1cfbdc1-a4a6-490a-95fc-77c111fe4117","resolution":{"observed_at":"2026-08-04T14:43:23.664754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:23.764751Z","title":"What is artificial superintelligence?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.764751Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:ef373cb3d2c8eb6f44d498bc02e0aad3b85f9ca505001f2223da55c79d3d830d","observation_id":"9788c601-c4b5-4d58-b29e-254452e3d465","resolution":{"observed_at":"2026-08-04T14:43:23.764751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-08-07T04:21:43.190472Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-08-04T14:43:23.915163Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:23.915163Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:fe27eb92b4a1b6e10975155de2471b8fe293c0e5717b1b80da55ace91e5426dd","observation_id":"3bb4a197-ca86-4646-abab-89e9b6fe6c97","resolution":{"observed_at":"2026-08-04T14:43:23.915163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:24.294757Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:24.294757Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:791a12d462bc6c6508e22b51e04945d6f166ba397bd9654e2e7b063e3c7b945c","observation_id":"9c197115-645a-4f2e-acd0-9db7f5d71f97","resolution":{"observed_at":"2026-08-04T14:43:24.294757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:24.415276Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:24.415276Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:1f13817686d140d960d4e56018df445269ec76323f4eafa0385a7d0f30216809","observation_id":"fd170c12-df61-4bbd-a660-c882d507609f","resolution":{"observed_at":"2026-08-04T14:43:24.415276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:24.624754Z","title":"Chen, Xi Chen, Tamim Asfour, Pieter Abbeel, and Marcin Andrychowicz","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:24.624754Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:03856a5f0930dce721cab32acac2982114c476bff30377a172744159ddb60b82","observation_id":"49155d3b-e903-42c3-a3cc-b920057a2491","resolution":{"observed_at":"2026-08-04T14:43:24.624754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:24.787960Z","title":"Semantic density: Uncertainty quantification for large language models through confidence measurement in semantic space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:24.787960Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:dad264820dfb3c81f15c300a9bd362c9c19f02073af23be1e78bd9b6631b496c","observation_id":"49a2d506-5899-4534-a9bc-98b445aefd8f","resolution":{"observed_at":"2026-08-04T14:43:24.787960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:24.934759Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:24.934759Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:b77ab3b20746afdb53d004152fad31d28df65304103d41521d16952bb34cb763","observation_id":"8e7782ce-fd85-4227-b42a-3ca5eb9fa557","resolution":{"observed_at":"2026-08-04T14:43:24.934759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:25.124738Z","title":"Rechenberg","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.124738Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:85700ce28a1d3fc20d07a791e0c8583201f27d8686b79978203e71c4756b20cc","observation_id":"9b669db8-8f19-4a24-b1d5-b8806868d090","resolution":{"observed_at":"2026-08-04T14:43:25.124738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:25.304763Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.304763Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:59ef3a5f058bb7e80bebe94c272b08e59ae32c0af86d7374db58ac99c2504b66","observation_id":"4ae9bac0-f017-4e12-b2f2-e81f9066e6fe","resolution":{"observed_at":"2026-08-04T14:43:25.304763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:25.494752Z","title":"Pawan Kumar, Emilien Dupont, Francisco J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.494752Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:5778d31d39ea0938b8fdd0a686653f918f07634436e19ccc13f1b96b8593486f","observation_id":"ce995643-c078-4e58-9949-c8c8c866b226","resolution":{"observed_at":"2026-08-04T14:43:25.494752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-04T14:43:25.564745Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.564745Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:5893a55496940249c406e5cf7241b18a37c3ae10adeae4571bccec71850a8111","observation_id":"4167e780-7675-4cd8-8104-dc36299a2d36","resolution":{"observed_at":"2026-08-04T14:43:25.564745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:25.646284Z","title":"u ckstie , Martin Felder, and J \\","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.646284Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:40c9f32ebc983a788bf06bc9ec6fadd93bae215525dbc96303d96c557d851306","observation_id":"cd28f1ad-0bf8-4a59-bcbb-b5d4477a3d64","resolution":{"observed_at":"2026-08-04T14:43:25.646284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2478/s13230-010-0002-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"u ckstie , Frank Sehnke, Tom Schaul, Daan Wierstra, Yi Sun, and J \\","venue":"Paladyn Journal of Behavioral Robotics","work_id":"3bf177f2-fe1b-4824-a246-2a9f23a43758","year":2010},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.755143Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:82f7242dca00c98d3c94173b3a8b3006581893ae5b015f15b764ea4176865f12","observation_id":"0563fd3f-7e40-414d-9928-66ac14c64292","resolution":{"observed_at":"2026-08-04T14:49:22.811963Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:25.834738Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.834738Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:0e8259cc4ac1fd53989754c0a12996d53c6b888995fec812545d054e54a86b5d","observation_id":"2aa166e2-0e31-4c69-9a1c-63de63bc6595","resolution":{"observed_at":"2026-08-04T14:43:25.834738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-04T14:43:25.910796Z","title":"Evolution strategies as a scalable alternative to reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:25.910796Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:77e337bede5b7d00c47463ad773a6d3201d1ebbe007a08fbf5bf14fe8148569f","observation_id":"a1127278-1185-41d4-b12a-b84bf56d8fc6","resolution":{"observed_at":"2026-08-04T14:43:25.910796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.insights-1.4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How well can a genetic algorithm fine-tune transformer encoders? a first approach","venue":null,"work_id":"38860fc6-e49a-4c1f-b814-902e7d329358","year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.187680Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:31a2cdb8b7d84046574dde4f8ea3f0584991b18159d61d453bce3f1040deb7c5","observation_id":"1c269cfe-a434-47ab-b6c9-81da6b750074","resolution":{"observed_at":"2026-08-04T14:49:22.554438Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:26.317534Z","title":"Approximating kl divergence, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.317534Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:5475c87707e45011202766d8a6460d85ca37c384da4c1668ff2d1caab8e75a68","observation_id":"56aaed94-1d56-4d14-9a96-75d295c6917c","resolution":{"observed_at":"2026-08-04T14:43:26.317534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T14:43:26.444749Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.444749Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:638a99632a1f165119030bc30bddb707384c946fbd85640f958bb56afea1e6a3","observation_id":"1a2957ed-851b-410d-9d65-94988b818858","resolution":{"observed_at":"2026-08-04T14:43:26.444749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-0348-5927-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Numerische Optimierung von Computermodellen mittels der Evo-lutionsstrategie, volume 26","venue":"Birkhäuser Basel eBooks","work_id":"d0e69fd2-03cb-4b7b-8ee8-242a920b3b6c","year":1977},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.595147Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:59336de349b24a5bf285d5c62e96ad40d354571daa52e128f2edfa47770d1d78","observation_id":"566bc3db-07ed-4778-b751-b2526b58273f","resolution":{"observed_at":"2026-08-04T14:49:22.266846Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:26.744734Z","title":"Parameter-exploring policy gradients","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.744734Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:0284600c39ea4320829971e39fdf45b17f419e5c61f85d39467d524e13ec4497","observation_id":"021a19c9-2ada-4bc5-ad18-5b943bbf7621","resolution":{"observed_at":"2026-08-04T14:43:26.744734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T14:43:26.852975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.852975Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:e41fc9f7f233f8160f5a8b4d6224914c553b67040a21395a4134a868596c970a","observation_id":"5299c176-c970-41f7-96bf-b9b272b65ff1","resolution":{"observed_at":"2026-08-04T14:43:26.852975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-04T14:43:26.960792Z","title":"Sara Mahdavi, Joelle Barral, Dale Webster, Greg S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:26.960792Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:b0878ee29ae7ade982be4150bf304f201905742760509da04a2ef31bbcc00944","observation_id":"80b23c43-5d60-420b-8886-818a98ec6671","resolution":{"observed_at":"2026-08-04T14:43:26.960792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:27.025445Z","title":"PRMB ench: A fine-grained and challenging benchmark for process-level reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.025445Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:9689fa260370fd9fc9e6ad0ef4d547d740f4ba59c429e537bf81b821bc04664d","observation_id":"f9c38cc8-5575-47ec-ae15-97c78348dc49","resolution":{"observed_at":"2026-08-04T14:43:27.025445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:27.126234Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.126234Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:b62c4dc06db56990d9e5bdb098e792195843d6f119a8bd139642cc6077a6a999","observation_id":"557e0319-cb47-450b-958b-5bc0fad95dd4","resolution":{"observed_at":"2026-08-04T14:43:27.126234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-08T15:50:06.172618Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04136","snapshot_observed_at":"2026-08-04T14:43:27.174129Z","title":"A technical survey of reinforcement learning techniques for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.174129Z"},"links":{"cited_paper":"/paper/2507.04136","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:a99f1d9b9efa1448f8728f438cbbdf244b490ce156cb46961edd25b7d8c24fba","observation_id":"73b5aced-ca17-4bc6-8dc1-f4374deccddc","resolution":{"observed_at":"2026-08-04T14:43:27.174129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06567","last_updated":"2018-04-20T18:38:34Z","snapshot_observed_at":"2026-08-03T09:28:27.095641Z","submitted_at":"2017-12-18T18:22:05Z","title":"Deep Neuroevolution: Genetic Algorithms Are a Competitive Alternative for Training Deep Neural Networks for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06567","snapshot_observed_at":"2026-08-04T14:43:27.246511Z","title":"Stanley, and Jeff Clune","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.246511Z"},"links":{"cited_paper":"/paper/1712.06567","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:18b7fa596095d9bd8a751d0fad29604ac07870ee21d734392ffa0e577bef9159","observation_id":"0991185e-9785-45f6-88f2-3b8b01088df3","resolution":{"observed_at":"2026-08-04T14:43:27.246511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.259","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BBT v2: Towards a gradient-free future with large language models","venue":null,"work_id":"147845a2-184c-40f2-9b2c-079f920793e9","year":2022},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.374747Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:9e7050400dfc8eaf3bf6282bbdf1003a71d1d95b615d124dc3eaacdf6c344eaa","observation_id":"e3c6fe67-92a7-4f31-a208-e7efb0061d44","resolution":{"observed_at":"2026-08-04T14:49:21.997293Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:27.448579Z","title":"Black-box tuning for language-model-as-a-service","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.448579Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:2a1b1022d6db8b98c87fe419cc897b6ec5983a72aab9e1c0bc417dda1f984ee4","observation_id":"b60689ed-5695-4a7d-9fbc-0ae90570da75","resolution":{"observed_at":"2026-08-04T14:43:27.448579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:27.506331Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.506331Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:e516e466eb2949e591865857be9a63310704ace97c21aac751d60fd1e5a61b27","observation_id":"250e12ca-d12d-4cac-8249-0cb6d5168f45","resolution":{"observed_at":"2026-08-04T14:43:27.506331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:27.586741Z","title":"Fine-tuning mt5-based transformer via cma-es for sentiment analysis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.586741Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:70bb5ba16c9d32bce8ed9086eb01a862a6c238bdad64f13073b5bd70b908ef24","observation_id":"3e7e83d6-a8de-44e9-8cab-319f86980e50","resolution":{"observed_at":"2026-08-04T14:43:27.586741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T14:43:27.686155Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.686155Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:6546334da377b08dbba031e51c2ebac4ad8eb4ae72b8ea9a2a71aec347869e31","observation_id":"93e0ef8b-6fba-4725-ab17-0d57ec27dc60","resolution":{"observed_at":"2026-08-04T14:43:27.686155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-04T14:43:27.886374Z","title":"Solving math word problems with process- and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:27.886374Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:e711f15e6ed6c5db67a61f8d3928ccf2bb351450fdf55485acc2d0d583fa5851","observation_id":"8fd0b78e-4c31-44bd-9bf2-edcd19b001ad","resolution":{"observed_at":"2026-08-04T14:43:27.886374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:28.045066Z","title":"Andrew Bagnell","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.045066Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:063c90bc7679586c124f5ba4ba4bb8c5138b442954ab5f75148b9cf0d2b3aad3","observation_id":"2139c937-4a60-4a80-89cd-74df5b9b7a4a","resolution":{"observed_at":"2026-08-04T14:43:28.045066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:28.108064Z","title":"When large language models meet evolutionary algorithms: Potential enhancements and challenges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.108064Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:1f76a0818422806c2683d0f8f8473c64913617cd7576bb1eed661eac462910b8","observation_id":"4ae3ebca-2647-47f9-8859-f6d4bec14fb3","resolution":{"observed_at":"2026-08-04T14:43:28.108064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:28.295794Z","title":"Natural evolution strategies","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.295794Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:0272ad103218323f74b244e913d1df7cb52717f0b4f22f888af079a607268603","observation_id":"03e3f036-81ac-425e-a968-a3352427da62","resolution":{"observed_at":"2026-08-04T14:43:28.295794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:28.396359Z","title":"Natural evolution strategies","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.396359Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:db3b5e33a0e47b5d6df6bf4c32cbf5e17b1e9c2c08f8b370e5aead01513e63d9","observation_id":"20c6296a-1bc3-4eed-b3bb-27e7ec4859ad","resolution":{"observed_at":"2026-08-04T14:43:28.396359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-04T14:43:28.534733Z","title":"Bloomberggpt: A large language model for finance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.534733Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:678cb2bf7849ea211a3de5994a202c162b1e2d57df0b5e9755839278578bb880","observation_id":"fa1b9614-df6d-42fb-a2b3-d94f7d0fad23","resolution":{"observed_at":"2026-08-04T14:43:28.534733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:28.654757Z","title":"Evolutionary computation in the era of large language model: Survey and roadmap","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.654757Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:69ec715cd2757aa72fb26cb6aac96cb4b09db21433de36116a66f2b1053b3f0d","observation_id":"d2d6254c-a23b-4b63-bddf-c1b91fc01fee","resolution":{"observed_at":"2026-08-04T14:43:28.654757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-04T14:43:28.822086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.822086Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:1cd19dff530d457c3634db0d59c1e4754b1177ef3c0d17471d288fa7f45e98cc","observation_id":"09d98d04-fe78-4afc-86f1-89a15c6fd4f5","resolution":{"observed_at":"2026-08-04T14:43:28.822086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06564","last_updated":"2017-12-18T18:17:21Z","snapshot_observed_at":"2026-07-06T06:14:56.693337Z","submitted_at":"2017-12-18T18:17:21Z","title":"On the Relationship Between the OpenAI Evolution Strategy and Stochastic Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06564","snapshot_observed_at":"2026-08-04T14:43:28.925179Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:28.925179Z"},"links":{"cited_paper":"/paper/1712.06564","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:3ae30b5918e4cc3c957b6a049bbff50d71e0ddebb680c2db410c4c71a869bb5b","observation_id":"4e249551-1814-407a-93e2-139675d2d875","resolution":{"observed_at":"2026-08-04T14:43:28.925179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-04T14:43:29.015865Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.015865Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:c559acb1e2960bac4d678797fd86cc803e44bd9b879090acdb963fb5d345f1cd","observation_id":"c862fcb1-73f3-4966-b6bd-508ff12f6e4e","resolution":{"observed_at":"2026-08-04T14:43:29.015865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2023/588","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genetic prompt search via exploiting language model probabilities","venue":null,"work_id":"4a28af05-9b7f-4d36-8339-32ba1825a280","year":2023},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.112085Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:7e6a2d9b3ada1d634427d5adc216d66619d8d7788d41d7252eb9d6e02051c618","observation_id":"7e12e69a-8c2d-48c9-aea7-2f66a762bb1d","resolution":{"observed_at":"2026-08-04T14:49:21.859507Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:29.366209Z","title":"DPO meets PPO : Reinforced token optimization for RLHF","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.366209Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:22e91a958b6f064846bf5cebfbd68a95fa08abd42189f17ab0b669e30c42fd87","observation_id":"cea816d8-261a-442c-b0f6-df389bed24ac","resolution":{"observed_at":"2026-08-04T14:43:29.366209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:29.468661Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.468661Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:b0fd79dbcc5c0d7941dd8d1f7a103f6c8baa4269f6dae3f7a598957de2061fa1","observation_id":"a6d9c6a0-4abc-4204-8649-b723d2a9f70d","resolution":{"observed_at":"2026-08-04T14:43:29.468661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:29.624735Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.624735Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:6d57cfe70feb1dbcf60670232cef4147d0e740df11def0272d394c1ab4ab37c4","observation_id":"3140f06a-fd27-456b-be01-aaf1d282cf6d","resolution":{"observed_at":"2026-08-04T14:43:29.624735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:29.761120Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.761120Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:c83e56ec0a0bf22e51eae0b4acf329ae8b245cc82df04ac86baafdc3025c36e0","observation_id":"96b62c46-9c97-4f38-a72e-af0097894cdf","resolution":{"observed_at":"2026-08-04T14:43:29.761120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:43:29.945895Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:29.945895Z"},"links":{"citing_paper":"/paper/2509.24372"},"observation_digest":"sha256:90865b7c9c385aa862517c8f9dc6385f7b7fa66ef76485912da49fc8ec5bce71","observation_id":"b6c09985-6d31-4ba6-aefe-be9ccd556db6","resolution":{"observed_at":"2026-08-04T14:43:29.945895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:46:47.440877Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 8 inbound Pith citation observations for arXiv:2509.24372."}