{"as_of":"2026-08-08T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fceb056c1772352d8453c966e0d88415a1adea36077aef54cfcd29ce5422b96","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:15:19.895698Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19408/citation-record","integrity":"/paper/2607.19408/integrity","json":"/paper/2607.19408/citation-record.json","paper":"/paper/2607.19408"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.155018Z","title":"Dense reward for free in reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.155018Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:901bfb2880f74f52bc8a6ce1cab4ca38850a3f922ac8313273e26a28bc9c8fe3","observation_id":"c1612773-4807-4786-bf15-1d21f04b9e95","resolution":{"observed_at":"2026-08-02T08:15:19.155018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T08:15:19.226461Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.226461Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:62642a552b851475a74bcc6acaec9156e238b7f1a6e6916d65e13a1d682c8381","observation_id":"40d49530-339c-4270-b019-946119d79488","resolution":{"observed_at":"2026-08-02T08:15:19.226461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-02T08:15:19.305019Z","title":"Process reinforcement through implicit rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.305019Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:b0bcec48d3a8281e35de678688835028ee11266f8778d9d7ce140607d053e2ff","observation_id":"074ee4f9-2342-4368-a7fd-4c482f5cae8a","resolution":{"observed_at":"2026-08-02T08:15:19.305019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-08T01:11:30.324736Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-02T08:15:19.428563Z","title":"On designing effective rl reward at training time for llm reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.428563Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:88f08650ef8a236c7fa807fbf2ae521a834efb2a1dbe75eca8f76f22225458df","observation_id":"6d1654b2-3948-476e-b468-3357d054e2fa","resolution":{"observed_at":"2026-08-02T08:15:19.428563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.490631Z","title":"To- ward semantics-based answer pinpointing","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.490631Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:90c43215ac0282eaadb110a4c35dd7c5c021150178f48f6bd7d8cf5e52a00dc9","observation_id":"46f5c39f-8313-4aa0-9ac9-69f2cf5d1d19","resolution":{"observed_at":"2026-08-02T08:15:19.490631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.522302Z","title":"Learning question classifiers","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.522302Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:5ffe8f0a89cc6ead33f2b84794afacb696ad69156a01c8b33252329b3a11156b","observation_id":"bc50babb-2fbf-4087-9e68-88def37e6412","resolution":{"observed_at":"2026-08-02T08:15:19.522302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.589635Z","title":"The blessing of dimensionality in llm fine-tuning: A variance-curvature perspective,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.589635Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:7b6b1ba304fc4fcd1192a37fe9b819f6b66ed8e8f19bde1a5e2d8b71070d8d13","observation_id":"a0dd0eec-1ae5-4e4b-9bbe-33b6c4f532e3","resolution":{"observed_at":"2026-08-02T08:15:19.589635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.810036Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.810036Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:1e5d8bc1a375427a1c4730825d38310523e1f41d993e9eb85d6e16754bbd3eac","observation_id":"a608cb4e-066c-46d2-a96b-0efe913ebcc4","resolution":{"observed_at":"2026-08-02T08:15:19.810036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-02T08:15:19.844834Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.844834Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:782937a9fd59a8f655bd61d4bd7fb9fa4cd94b2faff7b2d477c8d2c01d255032","observation_id":"2ebc1bba-b51e-4233-a9f0-d6d44130e546","resolution":{"observed_at":"2026-08-02T08:15:19.844834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.849014Z","title":"Lee, Danqi Chen, and Sanjeev Arora","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.849014Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:9ecbcaa9b2508e19a990710fbd61d657d434b8cba6bf426c8198bb744c46d52f","observation_id":"95156e19-0ec0-4a9b-8fed-b26b49ecb5f0","resolution":{"observed_at":"2026-08-02T08:15:19.849014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.852682Z","title":"Random gradient-free minimization of convex func- tions.Foundations of Computational Mathematics, 17(2):527–566, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.852682Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:8b63cd60fdb8ed31856be4a0f22edc8d343db50bdf0297a7cb27ad3fd55f313c","observation_id":"3b3dc49c-f664-4945-bf09-e5979f0b8983","resolution":{"observed_at":"2026-08-02T08:15:19.852682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24372","last_updated":"2026-07-14T15:11:12Z","snapshot_observed_at":"2026-08-06T13:33:46.319626Z","submitted_at":"2025-09-29T07:19:34Z","title":"Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24372","snapshot_observed_at":"2026-08-02T08:15:19.856120Z","title":"Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Mey- erson, Babak Hodjat, and Risto Miikkulainen","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.856120Z"},"links":{"cited_paper":"/paper/2509.24372","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:68806aa3f24b4f3b463f67c89c3a0aa43130128318022e4a0616f2b4a6124c3c","observation_id":"1fa9f782-49b7-4896-a4c0-e3fef6f00255","resolution":{"observed_at":"2026-08-02T08:15:19.856120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T08:15:19.860627Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.860627Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:5ec9bb380fabf178e85b075ecdcefba47ff973e5511c2ef82e0cc58e1e593768","observation_id":"a1adf360-e185-4376-8a4b-a3b016651d6b","resolution":{"observed_at":"2026-08-02T08:15:19.860627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-07-06T05:33:17.404544Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-02T08:15:19.864221Z","title":"Evolution strategies as a scalable alternative to reinforcement learning, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.864221Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:d3e6b3e4816fcc35e5f155dca0d9122539e230fc7e64f5b69e675382fbb9199a","observation_id":"cf62eb38-1832-4f7b-8297-a56ac2031945","resolution":{"observed_at":"2026-08-02T08:15:19.864221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.867837Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.867837Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:7dd5a0cd5ce99919354306eb40e6fedfcc19ba158d0be5ec659dfa19f36be91e","observation_id":"48289a40-839e-4a98-92ad-a85a1f47eab6","resolution":{"observed_at":"2026-08-02T08:15:19.867837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.871408Z","title":"Black-box tun- ing for language-model-as-a-service","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.871408Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:5759ac5b0a66397dacb090a4a3d79ec4779fb4dfcb60d900c777d9dc997164b9","observation_id":"850ab672-14f4-424d-8163-5446b0ebc093","resolution":{"observed_at":"2026-08-02T08:15:19.871408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.874508Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.874508Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:b5be617d75ee9304c2bda159eafe7bfd84278f9f2cc89e61bf79acd875c29ed9","observation_id":"4629c3be-53c4-4be3-892d-318b66d519d9","resolution":{"observed_at":"2026-08-02T08:15:19.874508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-ac","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:18:25.805881Z","title":"TLCR: Token-level continuous reward for fine-grained reinforcement learning from human feedback","venue":null,"work_id":"53a58c10-facc-4762-bfd5-7f57c68f87dc","year":2024},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.878269Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:43f02e94520af9f16cdc85e9ac59024136661e2b47c813c047d107cd421833a1","observation_id":"2eb6ba90-93c3-447c-bb2f-ee3a8d42ce8d","resolution":{"observed_at":"2026-08-02T08:18:25.912187Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.881783Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.881783Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:247f196b0cc646444f5947fbd3c2d468a104774b9c484811d61c6bf3daa244ca","observation_id":"0beb7bd1-65e7-4566-adbb-47e7684e278a","resolution":{"observed_at":"2026-08-02T08:15:19.881783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.885366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.885366Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:e7aa30ab222bd26566f3be969676a4f8b712b6e2e6569753cbad5656f4152d49","observation_id":"10f428bd-cdf0-4a13-b936-84da42b94da2","resolution":{"observed_at":"2026-08-02T08:15:19.885366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.888832Z","title":"Total cost:2KB forward passes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.888832Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:d35b198bfae2d54aff1506d8bd55b035e01f18a9579f42a86ad76ebdc37ff4f0","observation_id":"47647dd0-8559-4301-92c2-4581983fdba1","resolution":{"observed_at":"2026-08-02T08:15:19.888832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.892116Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.892116Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:cfebcbb6725900537ec398bfa80f23535da166e07b2a2af9fa1f771893a68e4f","observation_id":"8c6a4a03-9ce0-4561-b582-cdd0774c74d4","resolution":{"observed_at":"2026-08-02T08:15:19.892116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.895698Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.895698Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:7e5e4acc29b98685c1f2fba0a2798f898fa2a314e9783a222c2ab6bdcf41006c","observation_id":"096c7ef5-696a-43fc-b7c3-5fe9d76ac254","resolution":{"observed_at":"2026-08-02T08:15:19.895698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:15:19.670505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T08:15:19.670505Z"},"links":{"citing_paper":"/paper/2607.19408"},"observation_digest":"sha256:30005ac567c03e82becfdbf3f8672948c346b2e9f7f9a1d1caa3d300c9a50504","observation_id":"4a631a5b-30bc-42c8-bba2-f4afe7a0d02b","resolution":{"observed_at":"2026-08-02T08:15:19.670505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19408","last_updated":"2026-07-08T00:19:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T13:34:20.391930Z","submitted_at":"2026-07-08T00:19:03Z","title":"Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.19408."}