{"as_of":"2026-08-05T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:434debbfa6cdb351cbb9d0408502149d587723b8e29ca33f8036f6ea8fce3ee6","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.13399/citation-record","integrity":"/paper/2512.13399/integrity","json":"/paper/2512.13399/citation-record.json","paper":"/paper/2512.13399"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:92d79a2949eba3069d1b7a936924919da72fcb6f2e50769396ee56409db3b073","observation_id":"02d0721f-e551-4110-9805-1acf73e1e890","resolution":{"observed_at":"2026-05-16T22:38:37.742178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04474","last_updated":"2016-11-30T16:45:45Z","snapshot_observed_at":"2026-07-06T04:59:57.758055Z","submitted_at":"2016-06-14T17:49:32Z","title":"Learning to learn by gradient descent by gradient descent","version":2},"cited_work":{"arxiv_id":"1606.04474","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.04474","snapshot_observed_at":"2026-07-10T19:07:35.050077Z","title":"Learning to learn by gradient descent by gradient descent","venue":"cs.NE","work_id":"9919eb6a-fde4-4d39-8047-21197365166d","year":2016},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/1606.04474","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:bebd02354926bbf93bb84358e13f8c0c9eb9e7d43b2dde0f02fc1a0fda716c1e","observation_id":"e5d5fe68-ef3b-40f3-bda5-7b98e841a8c9","resolution":{"observed_at":"2026-05-16T22:38:37.718469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"under review","venue":null,"work_id":"f199d869-08bd-48c0-9a77-0e81bc5884b6","year":2017},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:1f4753ba6738a195aec2adb3904008becf8017fd3dc818b0bdf873c38f6f6596","observation_id":"ae785887-de13-494b-b684-03be65f54ed3","resolution":{"observed_at":"2026-05-16T22:43:38.780793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xiangning Chen, Chen Liang, Da Huang, Esteban Real, Kaiyuan Wang, Hieu Pham, Xuanyi Dong, Thang Luong, Cho-Jui Hsieh, Yifeng Lu, and Quoc V","venue":null,"work_id":"553680c9-3aa5-4d00-8f57-a63d5e24c52d","year":2023},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:ec9a0204e8c7476154561de11dd26bc321af07be68aa708a23e448fe3ea095f0","observation_id":"7e28bf47-f990-47bc-8c8b-9558c4b3591b","resolution":{"observed_at":"2026-05-16T22:43:38.786382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xingwu Chen, Tianle Li, and Difan Zou","venue":null,"work_id":"0aa79354-51a4-4a06-8f4d-ea1af0dd88e4","year":2023},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:ea043972c57e6e921cb8f07eb8ca98a86f5c584370b5077e5573d03381ed69fd","observation_id":"69b1c518-69f0-4530-9e6e-f0f74d4be013","resolution":{"observed_at":"2026-05-16T22:43:38.782676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:650700c89af87f13c99e627c08d03f983a6560ea220d8f9b6692c8da7de0342e","observation_id":"ddef9326-458f-4dbf-b92a-4d74043a8a36","resolution":{"observed_at":"2026-05-16T22:38:37.676556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07407","last_updated":"2025-08-31T14:55:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-10T16:07:32Z","title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","version":2},"cited_work":{"arxiv_id":"2508.07407","doi":"10.48550/arxiv.2508.07407","metadata_source":"pith","pith_arxiv_id":"2508.07407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","venue":"cs.AI","work_id":"10037f9e-62d9-4dd1-a9c1-44be77032524","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2508.07407","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:c4fa1c2e9e7bf5bccae19db920590717459c518df740715fad7a9cd94dc16470","observation_id":"9d366ba9-077b-4570-8acd-a65603b4e8cb","resolution":{"observed_at":"2026-05-16T22:38:37.726446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:6a4a9356054ed0f5a929864faa380437ff14921db6f5b64247033c8562a280c0","observation_id":"77d0c7bd-4d6f-45a5-99c4-4b131f0726ac","resolution":{"observed_at":"2026-05-16T22:38:37.745778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"cited_work":{"arxiv_id":"2507.21046","doi":"10.48550/arxiv.2507.21046","metadata_source":"pith","pith_arxiv_id":"2507.21046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","venue":"cs.AI","work_id":"f5de9511-98bf-411c-9eba-e8b7a914ec18","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2507.21046","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:a932e03f1c1d475c829f5b7eacbfdb638d3931640e29575ff34255f749fb1b4b","observation_id":"11ce5c06-1edb-43c9-bd2c-3a02c38fd0ea","resolution":{"observed_at":"2026-05-16T22:38:37.734181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:10.122082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:10.122082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:787477a6200089999f5f2863dd0c65997808a35368e035a9df0010d6f0385514","observation_id":"d49a2ebe-7c23-49c9-8545-a5733f40a76f","resolution":{"observed_at":"2026-05-16T22:38:37.752791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09846","last_updated":"2017-11-28T16:16:21Z","snapshot_observed_at":"2026-07-06T06:11:24.949724Z","submitted_at":"2017-11-27T17:33:27Z","title":"Population Based Training of Neural Networks","version":2},"cited_work":{"arxiv_id":"1711.09846","doi":"10.48550/arxiv.1711.09846","metadata_source":"pith","pith_arxiv_id":"1711.09846","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Population Based Training of Neural Networks","venue":"cs.LG","work_id":"252bc4d9-2cae-4a9a-98ba-b954ab35a78b","year":2017},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1711.09846","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:214d14b3fa876681629d8fd885ac1686ac221091ce35941cadb97c6bfbba3ae8","observation_id":"b64778b3-9b74-4f4c-b318-f75442a5e210","resolution":{"observed_at":"2026-05-16T22:38:37.424143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:59.706755+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:59.706755+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.02094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wurman, Peter Stone, and Craig Sher- stan","venue":null,"work_id":"0cbad783-b799-4205-977c-1a5281d02dee","year":2024},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:e7d65443a495ba8d2f103913c5e3f7a8228125bc816bfa855c8a202f54d37611","observation_id":"08fc1195-f40c-453e-a9fb-c5cb81c61012","resolution":{"observed_at":"2026-05-16T22:38:37.672326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":"2506.13131","doi":"10.1016/j.shpsa.2017.03.005","metadata_source":"pith","pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","venue":"cs.AI","work_id":"76a0f850-d490-4e4f-ab98-8d25df82cd23","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:e6ae9d89d1ce822a13f62f12a7dc89eec115ed205ea72d2a18e37fa6517cb659","observation_id":"5c674f03-8bbb-46bf-b136-246e8b664e66","resolution":{"observed_at":"2026-05-16T22:38:37.693784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":"2307.16789","doi":"10.48550/arxiv.2307.16789","metadata_source":"pith","pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","venue":"cs.AI","work_id":"3c555b48-a4d9-42dd-9fdd-0f6018fbe9cb","year":2023},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:8e4d57cfdc9405638da0858c78123dc7db3d670314f412f788473969da4a89c8","observation_id":"ba872648-a8ef-4272-a4ab-2978d8bd1187","resolution":{"observed_at":"2026-05-16T22:38:37.730345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-023-06924-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:17:23.574211Z","title":"doi: 10.1038/s41586-023-06924-6","venue":"Nature","work_id":"e3e0be4a-249a-44e7-a987-3fb2f9dd3f64","year":2024},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:2616dd8023d1ce22d34aa5bcbd23e157888b6017a7c14eeb0f3a15d986177d3f","observation_id":"07155f3e-0191-48e8-bd72-0133ca926e9e","resolution":{"observed_at":"2026-05-16T22:38:37.428031Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T03:52:21.750682+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T03:52:21.750682+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:35d07f81e5bbfdc8ee4b78ca38d672c33a44aa820a184076880cf74a0c96a009","observation_id":"c63261d8-6209-4c04-86b5-e20007f8028b","resolution":{"observed_at":"2026-05-16T22:38:37.680496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:4264ecfcee001c605d8e3372c764717b4074fbf5c770d95d9eef02f829bca84d","observation_id":"be81840f-ea11-4071-9bd2-3f56d03f9ab4","resolution":{"observed_at":"2026-05-20T00:00:28.487879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:b560f988d292be54ffb433964c150ef3b89d67f0884dac3150eb48e43541550c","observation_id":"b0b1d0be-cdb3-443d-89cf-8d1894fea4dd","resolution":{"observed_at":"2026-05-16T22:38:37.756424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:e094be4ad0a407d61991c9f607530a5bf78ee0df14b60d6295f3a46b198295c5","observation_id":"a0131b75-0c1e-445a-9292-c4c2df1c1743","resolution":{"observed_at":"2026-05-16T22:38:37.749379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:74dd6bd62d2dd752227254760c6f45cc62d2764ac3b4ee8d4e534a3138b999a8","observation_id":"e40a3bff-d5a5-4a11-925a-abe9a37bca9a","resolution":{"observed_at":"2026-05-16T22:38:37.710448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06567","last_updated":"2018-04-20T18:38:34Z","snapshot_observed_at":"2026-08-03T09:28:27.095641Z","submitted_at":"2017-12-18T18:22:05Z","title":"Deep Neuroevolution: Genetic Algorithms Are a Competitive Alternative for Training Deep Neural Networks for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1712.06567","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.06567","snapshot_observed_at":"2026-07-04T15:19:56.959885Z","title":"Deep Neuroevolution: Genetic Algorithms Are a Competitive Alternative for Training Deep Neural Networks for Reinforcement Learning","venue":"cs.NE","work_id":"93d95558-6ebb-4a43-9e99-c805715e436a","year":2017},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/1712.06567","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:c843e325b3b8e1c3f56c7ef9f26317cea4288237619747bf6d6b35dfd70d35dc","observation_id":"9d77cbbd-6597-417e-b19a-59dbf6b28ae3","resolution":{"observed_at":"2026-05-16T22:38:37.722482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2510.04204 (2025)","venue":null,"work_id":"e24f3315-dfe8-4459-8587-b0e9828e23cf","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:71c633390054fd61b0a9cde3e50c407c9999a19b09558049b06a7dd7c5e0c8de","observation_id":"6877c6ab-f718-438a-950a-ff54f58c54fa","resolution":{"observed_at":"2026-05-16T22:38:37.738299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-03T18:39:06.905747Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":"2203.07540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-07-07T16:24:01.070122Z","title":"InACL, pages 9426–9439","venue":"cs.CL","work_id":"06c02062-aac6-4fed-a547-067bbaa6f2ac","year":2022},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:eb9d0610fd833f0058774b08261b7b12bc5ca45f824a5ffb92b7e5ae2c0a8186","observation_id":"d1b91593-7745-4878-bc2c-2d09e2cb6153","resolution":{"observed_at":"2026-05-16T22:38:37.714865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":"2504.20571","doi":"10.18653/v1/2024.acl-long.643","metadata_source":"pith","pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","venue":"cs.LG","work_id":"75a5258b-4143-4f2f-99f3-6d950a496305","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:9d20f29632606966dd81d61e79d70a36cc4efa969895eaa0f2dc63fe3f3f0d63","observation_id":"2e67659e-2962-4cb4-b066-412c13cbcf6b","resolution":{"observed_at":"2026-05-16T22:38:37.697896Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16331","last_updated":"2026-07-03T09:17:03Z","snapshot_observed_at":"2026-08-04T13:00:59.547295Z","submitted_at":"2025-07-22T08:13:01Z","title":"Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny","version":4},"cited_work":{"arxiv_id":"2507.16331","doi":"10.48550/arxiv.2507.16331","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16331","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xunjian Yin, Xinyi Wang, Liangming Pan, Li Lin, Xiaojun Wan, and William Yang Wang","venue":"ArXiv.org","work_id":"fd1fc939-0d26-4c4a-8f64-6c365c688c31","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2507.16331","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:fe97144109cc2c9e75c5844dbb53b86471f2884cc6d1edb33e6b09857a03230e","observation_id":"8c4c22c5-3eba-4d9f-b069-19726470732d","resolution":{"observed_at":"2026-07-07T02:15:55.820429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:a774e723ff93c13794f10b5508494446b98ea3cf42bd8e1ca581017442ee253c","observation_id":"593fab5c-e79d-490c-ac22-edad954cf38f","resolution":{"observed_at":"2026-05-16T22:38:37.668024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22954","last_updated":"2026-03-12T23:47:40Z","snapshot_observed_at":"2026-07-06T21:32:33.515702Z","submitted_at":"2025-05-29T00:26:15Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","version":3},"cited_work":{"arxiv_id":"2505.22954","doi":"10.48550/arxiv.2505.22954","metadata_source":"pith","pith_arxiv_id":"2505.22954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","venue":"cs.AI","work_id":"c0d964a0-02a1-4ee2-a596-028489ba753f","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2505.22954","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:147d43c5e656dac50524accdebe373f2f558a6a571454c258ed9f1ae2100d04e","observation_id":"572b5b97-c897-463a-9d00-920974e3c058","resolution":{"observed_at":"2026-05-16T22:38:37.702055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:19.626419+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:19.626419+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-07-06T22:05:17.795002Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:5d30c4edf903d8adbc2831d9dd0022893e5065fe8ebe527fa73fc65683564eaf","observation_id":"78e53603-8078-4053-9f3f-5712016ef43b","resolution":{"observed_at":"2026-05-16T22:38:37.689797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"meta-gradient","venue":null,"work_id":"fad4c6e5-fb9c-49df-9644-653424bc5f4d","year":2024},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:e447acbc89e7987fb67c542346631f2cbb1b2e5430ad4b2ab06dcc783ba5f942","observation_id":"568bd4b0-c1c1-4645-bcc2-ce4612a1e737","resolution":{"observed_at":"2026-05-16T22:43:38.784432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":4},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2512.13399."}