{"as_of":"2026-08-16T09:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aaf414fb47aa7162718265bc65f8961603fff9630a85f7fb6893aacc59394aae","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:30:42.057301Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:32:38.114748Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03108","snapshot_observed_at":"2026-08-02T04:32:38.114748Z","title":"arXiv preprint arXiv:2606.03108 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13683","last_updated":"2026-07-15T10:26:26Z","snapshot_observed_at":"2026-08-15T21:34:40.741494Z","submitted_at":"2026-07-15T10:26:26Z","title":"Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T04:32:38.114748Z"},"links":{"cited_paper":"/paper/2606.03108","citing_paper":"/paper/2607.13683"},"observation_digest":"sha256:1778ff4772792ceae6a265271046521143ba1b5c1ada0dd8d2893a376513d649","observation_id":"7ddcb646-167c-4ac7-8c40-a26e10b1623a","resolution":{"observed_at":"2026-08-02T04:32:38.114748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.03108/citation-record","integrity":"/paper/2606.03108/integrity","json":"/paper/2606.03108/citation-record.json","paper":"/paper/2606.03108"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:60ed3bad86652acdaea2eca3b3e7bfe92dbcd03a3d65c7b9689d8c65970d0a43","observation_id":"a7ab1db5-7afa-4111-bc66-8c630582546d","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":"Darwin G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:ff47202ebd5f870c7bdf7ff15a7cf9588101756a13b0cd445759b4ff4387aa83","observation_id":"9aa53133-e85e-46b9-af69-3793cccce76b","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:b9f50f7d2e22debabae4ea8162d588536a14524b287ff5bbe6060833b796ff5c","observation_id":"14836864-8dd6-4b2c-8f94-d1051a907ffa","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:b195e7bdaac2f1ea177e646136c3b21d3c0d6dce75a314073586c54b01848e1d","observation_id":"9991e52e-6ec9-4eaf-83e5-09ce5f10699e","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:c3107e2879da37baf891895a09a9a37fb3263dfc6e8c5eea93225ba0bf74e25a","observation_id":"c0905de0-a5fc-4580-9d15-bbb4ae61df5f","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:2600c3f891476167be82a982783a67bc67f5e617ec627d37ab2c9cc0d2610e96","observation_id":"4fd1cc0d-8646-496c-9302-9055feee126c","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":"Advances in Neural Information Processing Systems (","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:6d7f6e3986fd189549010aa3a10b8732df569eedb95e579e8d5d4eff556a0c54","observation_id":"c80d199f-6e67-43ff-bece-84f5dbc9f20c","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":"Proceedings of the Thirty-Second","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:71fd4f3df53a20ac144236f73d8da74edd81b46373e3e39db8d953432ba719f6","observation_id":"8bd2eec7-180a-44ef-bd43-7e7037dad973","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:aab1a13aadd9febd118b424c4d60c70ec57d40051b9c1bef42265e4cb951a9f8","observation_id":"13fbd11e-5637-4764-990b-f94334b337ef","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":"Bellemare","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:1c2aa5194ff4bad0eda396cc0338b60c99ded912df64a57c60509c9838660e6d","observation_id":"9f438de2-b65b-4608-b838-150e6ccc60d8","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-16T00:35:20.589038Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":"2502.17387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-07-04T16:39:58.415508Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models","venue":null,"work_id":"00edb0c5-3c62-421d-a532-03e2594f1dba","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:461dadd8a74ea189fdac10aed3f96e9d6e46e9f6822370d22c28164129a6d78d","observation_id":"4229a3b1-0471-4e0b-b1b2-0def05f79229","resolution":{"observed_at":"2026-07-02T02:56:29.149115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:1e11885362ba6eb7141ad7933b6d994d9512e7038c63bc42a4640aa553d36b7f","observation_id":"eb5fcfef-e46c-468a-882d-7fe468754555","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20411","doi":"10.48550/arxiv.2505.20411","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents","venue":"ArXiv.org","work_id":"c819f5fe-32b6-41d1-aeb5-2d80c6fa8474","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:dbd1112be159d10ad3636084f96cf35d7591dbf37afceaba429b5e7318a41e0c","observation_id":"4f7bcaba-cd9d-469a-b9c1-8cade883d28d","resolution":{"observed_at":"2026-07-02T02:56:29.172057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:48.545398+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:48.545398+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:56:29.074389Z","title":null,"venue":null,"work_id":"132e038f-8fd4-4cc4-a90d-00a0dbded459","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:f1076a1fed4fdc27fbad2aa4909f1c54af8a8e4f8b39be8ae1310a798785128a","observation_id":"86c96cc9-33c8-4d74-9883-c7cccd025f6f","resolution":{"observed_at":"2026-07-02T02:56:29.076490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-14T15:03:39.227865Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":"2502.01600","doi":"10.48550/arxiv.2502.01600","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning for long-horizon interactive llm agents","venue":"ArXiv.org","work_id":"7e929792-6a2a-42ff-a1db-763f890d8b4e","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:add18fa8e8597b76ce782b5adb8c532df24a58129f65bfe92e5816b5ff4764be","observation_id":"eabaf675-ae68-45a3-9704-648abfd971f8","resolution":{"observed_at":"2026-07-02T02:56:29.163648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:56:29.061325Z","title":"arXiv preprint arXiv:2505.09655 , year=","venue":null,"work_id":"f303b12c-5cef-494d-a329-b01b36477b0a","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:68b704a4c7dc25723d8af211511268009a6073a3257b9badca627e90810d3f2a","observation_id":"df0da249-623f-44ca-83e5-5bec76037bda","resolution":{"observed_at":"2026-07-02T02:56:29.064402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08295","last_updated":"2018-07-05T06:50:33Z","snapshot_observed_at":"2026-08-14T19:00:54.814751Z","submitted_at":"2018-06-21T15:39:19Z","title":"How Many Random Seeds? Statistical Power Analysis in Deep Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":"1806.08295","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.08295","snapshot_observed_at":"2026-07-08T19:55:33.971005Z","title":"How Many Random Seeds? Statistical Power Analysis in Deep Reinforcement Learning Experiments","venue":"cs.LG","work_id":"4e911bc0-5394-4867-b4c7-90dba31bb148","year":2018},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/1806.08295","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:2d32a74ab64bc81a04edb0525a8079dd422fcc47bb5c74d70f9d07780723bd0f","observation_id":"18e13c95-ede7-4f47-8d4e-394a87fb00bf","resolution":{"observed_at":"2026-07-02T02:56:29.113814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:12f0441da023d3f3c15a6cd0ad57e3717a809f7bbb6b3d5ff37c41c4f5d4b9a9","observation_id":"201448c2-adc1-4eb4-b78d-a5d8f0035b45","resolution":{"observed_at":"2026-06-28T10:31:59.820179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-13T19:38:05.434011+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T19:38:05.434011+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:66a066e66e7359ae337f29e24411f3b9152e7492a5e01914730cdcbdc914cc5b","observation_id":"fd40d41b-5de1-4d40-8788-68d2d7c5f240","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:6af96af52bdd7b93cf20b0158f0da8a25ae96fc9b0a79d3c073f864d9935d511","observation_id":"9cc9bac4-8ee7-46e7-a7d2-dc24d144180f","resolution":{"observed_at":"2026-07-02T02:56:29.137790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-15T22:28:45.285943Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"cited_work":{"arxiv_id":"2602.14872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.14872","snapshot_observed_at":"2026-07-02T02:56:29.139436Z","title":"The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards","venue":"cs.LG","work_id":"b078b267-c10d-4a36-88a5-7bee845fc37b","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2602.14872","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:5d141da00263cf83efb206c23fcf46a4f9df90c1ba2f4539ee6d7f61a0a61ec9","observation_id":"bd8e608a-d9f9-4550-a120-4841c52efd17","resolution":{"observed_at":"2026-07-02T02:56:29.141647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:bfa184c1dda885d6d5927d97c450516f2a7506cd4c23b57b58fc3cfb496effed","observation_id":"fe3d4da6-9167-4967-aa75-8db0d155d2ba","resolution":{"observed_at":"2026-07-02T02:56:29.157015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13874","last_updated":"2026-05-08T00:25:09Z","snapshot_observed_at":"2026-08-11T16:02:18.827085Z","submitted_at":"2026-05-08T00:25:09Z","title":"GEAR: Genetic AutoResearch for Agentic Code Evolution","version":1},"cited_work":{"arxiv_id":"2605.13874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13874","snapshot_observed_at":"2026-07-02T02:56:29.091207Z","title":"GEAR: Genetic AutoResearch for Agentic Code Evolution","venue":"cs.NE","work_id":"bfa97ad3-0d5f-4f95-a1a8-e0ec3944f729","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2605.13874","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:f52f6c45476c384c36e80d8198fb53da144581e18ed5fa433c90bc1d312dd8d7","observation_id":"48063652-dd50-4ce4-9492-e02ce4bd88fb","resolution":{"observed_at":"2026-07-02T02:56:29.093104Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:dda0571703af154e56688d00c997c56f015749bdb97484777b61d43ed861123d","observation_id":"351c121d-b70c-4392-88a0-b6f0978d7e68","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-08-11T05:18:08.192130Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":"2603.28052","doi":"10.48550/arxiv.2603.28052","metadata_source":"pith","pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","venue":"cs.AI","work_id":"5be3c079-4ffa-458f-adcf-204b66f7af51","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:f23de4d9951a53e849167355a26b5f8e5eb200d42d28b999563eed8fde8d1761","observation_id":"865f7c78-f573-4cbe-ac54-c39a44b538b8","resolution":{"observed_at":"2026-07-02T02:56:29.160351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-08-14T08:53:27.956962Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":"2312.14852","doi":"10.48550/arxiv.2312.14852","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TACO: Topics in algorithmic COde generation dataset.arXiv preprint","venue":"arXiv (Cornell University)","work_id":"67740cc1-d973-4614-adf4-686babd14274","year":2023},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:d1fab63eb4e0b937a27e9c7f8a2e6bda14b3cefa012d4ad8e42b8534c968b215","observation_id":"f6d1447c-6761-4a27-8216-37b9b8595390","resolution":{"observed_at":"2026-07-02T02:56:29.160398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25850","last_updated":"2026-05-18T15:11:47Z","snapshot_observed_at":"2026-08-11T12:18:53.491481Z","submitted_at":"2026-04-28T16:55:02Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","version":4},"cited_work":{"arxiv_id":"2604.25850","doi":"10.48550/arxiv.2604.25850","metadata_source":"pith","pith_arxiv_id":"2604.25850","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","venue":"cs.CL","work_id":"207d40bc-1c5c-4a3b-97ec-547023798f8a","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2604.25850","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:846e30dfeb98ab449da2337b492e47ba028f46860718b001868f60791df876ef","observation_id":"cea56aa0-0857-42f2-8911-aa873dc0d96b","resolution":{"observed_at":"2026-07-02T02:56:29.149394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:59.364676+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:59.364676+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:1192d5cde6a475e725a91ac0219c6e672d73b02df5c9225ebaa197f60cc38f64","observation_id":"16819099-b622-421a-ab33-4351d30918c8","resolution":{"observed_at":"2026-07-02T02:56:29.117233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10628","last_updated":"2025-07-16T15:30:11Z","snapshot_observed_at":"2026-08-15T20:25:20.157944Z","submitted_at":"2025-07-14T08:10:00Z","title":"GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2507.10628","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10628","snapshot_observed_at":"2026-07-04T20:00:08.029366Z","title":"arXiv preprint arXiv:2507.10628 , year=","venue":null,"work_id":"e6ef51f6-345c-4a8e-9007-3f3df283b908","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2507.10628","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:6da74b6694055124092f23ebd9b479203a623953759c1abfa9f7b7e70ebeb805","observation_id":"faee7cf6-a254-4a18-9814-36bb86ca4520","resolution":{"observed_at":"2026-07-02T02:56:29.176018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2408.06292","doi":"10.48550/arxiv.2408.06292","metadata_source":"pith","pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","venue":"cs.AI","work_id":"56b6b58d-e73a-4317-896e-36ac5f84e957","year":2024},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:89655aea61e5ddea365ce45818c433a229cd6bfb17d58e20d7067cc5254fc76a","observation_id":"a6c679db-c435-4b5e-8c89-c3d8fc66ee43","resolution":{"observed_at":"2026-07-02T02:56:29.163873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:20.611352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:20.611352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05724","last_updated":"2026-05-07T06:13:43Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T06:13:43Z","title":"Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes","version":1},"cited_work":{"arxiv_id":"2605.05724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05724","snapshot_observed_at":"2026-07-04T09:59:45.805753Z","title":"Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes","venue":"cs.MA","work_id":"99b22a1d-b664-4878-b986-f6cbee52e18e","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2605.05724","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:485ca3e20430a428746a70d21b8a33b442f4220a6085b666cc9842e335567fc6","observation_id":"e080dda4-992e-4013-ab71-81215dd3dd21","resolution":{"observed_at":"2026-07-02T02:56:29.168678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-08-11T23:48:15.512738Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":"2506.13131","doi":"10.1016/j.shpsa.2017.03.005","metadata_source":"pith","pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","venue":"cs.AI","work_id":"76a0f850-d490-4e4f-ab98-8d25df82cd23","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:e83a97033f08a5fd41135ffb819d903ef121cb9ac20f0f868b22af171d86a5e0","observation_id":"bb38685a-7a15-4bf2-84fb-57702fa7e1d8","resolution":{"observed_at":"2026-07-02T02:56:29.084474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23420","last_updated":"2026-06-02T18:31:24Z","snapshot_observed_at":"2026-08-03T22:58:13.526728Z","submitted_at":"2026-03-24T16:52:25Z","title":"Bilevel Autoresearch: Meta-Autoresearching Itself","version":2},"cited_work":{"arxiv_id":"2603.23420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.23420","snapshot_observed_at":"2026-07-02T02:56:29.150871Z","title":"arXiv preprint arXiv:2603.23420 (2026)","venue":"cs.AI","work_id":"8dbaadfd-0882-48f9-93a5-3490303919a5","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2603.23420","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:a8d008fc47033ae947d0b00bf8e2d090aa62db4c6928a23f505b5fb78f4178a4","observation_id":"ffa8521e-96be-4abd-a6a9-bb6e505ca90b","resolution":{"observed_at":"2026-07-02T02:56:29.153238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:30:42.057301Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:22549ba62d7acec6c9e84e03b71e93e31e76652ccd465b9efdab9daecc4d7ad4","observation_id":"715a77f0-b58f-4318-8eaa-30ad14ac826c","resolution":{"observed_at":"2026-06-28T10:30:42.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:9fa5a80c22c8298fb9debde19a1cf36c7423a8a8027601da733c6ad80838333c","observation_id":"fcf8ba75-fec6-4f91-b745-c32721ea6b61","resolution":{"observed_at":"2026-07-02T02:56:29.156793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14387","last_updated":"2024-06-03T17:47:30Z","snapshot_observed_at":"2026-08-15T11:34:37.509503Z","submitted_at":"2024-04-22T17:43:23Z","title":"A Survey on Self-Evolution of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.14387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14387","snapshot_observed_at":"2026-07-04T10:59:47.067283Z","title":"arXiv preprint arXiv:2404.14387 , year=","venue":null,"work_id":"ffd0559d-37d0-4858-8aaa-84dc7e4a3541","year":2024},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2404.14387","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:216bbc922591d9d31041543a2a2df4a91f64d007dbae001cfa5a19f4bbb6c4aa","observation_id":"a3c8f0e7-376a-488a-89ae-ae90e6cf71a0","resolution":{"observed_at":"2026-07-02T02:56:29.129913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-08-13T19:20:01.823209Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":"2604.06268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-07-02T02:56:29.103440Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","venue":"cs.LG","work_id":"a226ed89-b777-4a0f-9e0a-17abeb1cac19","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:6540008f3eaf3f88d8a878d954679b05c66eb8f9f70555c2d02a9d52d6dbd5ae","observation_id":"b6466a17-bf3a-442d-9222-54bb04b8c50d","resolution":{"observed_at":"2026-07-02T02:56:29.105430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:c841f9f9f53384cd02052c778537219de2be60717797247995cd088acc7f9d1e","observation_id":"14f83664-ee98-4aa8-bae0-4d0bc5d1a688","resolution":{"observed_at":"2026-07-02T02:56:29.172159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:56:29.123673Z","title":null,"venue":null,"work_id":"eff02070-fa26-456f-814c-0be7aec6519a","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:72f9797d98efd3e8548a1fec42b67617b83ffb1d5533810649bd1e3485fdfeee","observation_id":"3780e028-fdfd-4c3b-b32f-8729e728679b","resolution":{"observed_at":"2026-07-02T02:56:29.125496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08066","last_updated":"2025-04-10T18:44:41Z","snapshot_observed_at":"2026-08-10T03:18:36.275195Z","submitted_at":"2025-04-10T18:44:41Z","title":"The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search","version":1},"cited_work":{"arxiv_id":"2504.08066","doi":"10.48550/arxiv.2504.08066","metadata_source":"pith","pith_arxiv_id":"2504.08066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search","venue":"cs.AI","work_id":"fa04f346-ee20-4e9d-bf04-3ad3569a8ed1","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2504.08066","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:0e133b29bc0741894408b1ba95ec66951cf9195b4628e49f98f4a7aad77c756e","observation_id":"78483e8e-add2-4202-86b9-6f75ba1c7e46","resolution":{"observed_at":"2026-07-02T02:56:29.137487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:27.206897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:27.206897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:3b2b96d41657dafda878b616fe42460df02190c287f4cd52556e735a26a6f0cc","observation_id":"06fe170b-1ac8-4284-bc72-4b7db3f2abdd","resolution":{"observed_at":"2026-07-02T02:56:29.113543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18639","last_updated":"2026-04-19T08:02:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-19T08:02:31Z","title":"Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2604.18639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18639","snapshot_observed_at":"2026-07-02T02:56:29.107097Z","title":"Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning","venue":"cs.LG","work_id":"96b350a1-19fa-41cb-b409-23fa2f5fffce","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2604.18639","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:27878f33413189baf3b26b027448bee4f8412df115b86abccf6af9abd515f63e","observation_id":"5bcca6bf-293b-4752-b7da-98a8dde3362c","resolution":{"observed_at":"2026-07-02T02:56:29.109678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-14T01:03:13.684234Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:5ea7f93e5f038dd4d6560b1cf48ecf11d347c1992dc23bb478fe53fb4214a8ac","observation_id":"1f8654e5-305c-46fe-9781-a682b495bb4e","resolution":{"observed_at":"2026-07-02T02:56:29.080522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22954","last_updated":"2026-03-12T23:47:40Z","snapshot_observed_at":"2026-08-13T19:47:12.152634Z","submitted_at":"2025-05-29T00:26:15Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","version":3},"cited_work":{"arxiv_id":"2505.22954","doi":"10.48550/arxiv.2505.22954","metadata_source":"pith","pith_arxiv_id":"2505.22954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","venue":"cs.AI","work_id":"c0d964a0-02a1-4ee2-a596-028489ba753f","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2505.22954","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:484886870802868e2534b867bdc72126bc0029b0383d5a9a3b886fc593cca174","observation_id":"148e3c70-6848-4df5-ba8e-a552e8a8b7fb","resolution":{"observed_at":"2026-07-02T02:56:29.145323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:19.626419+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:19.626419+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:42ec8a29c845c4b64455c3b4fdc4f89c728778da3b8b15a978895baed9009812","observation_id":"e2fc6487-0ff5-4d4e-a8ac-2b3ef55e6256","resolution":{"observed_at":"2026-07-02T02:56:29.145569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T15:01:56.287299Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":14,"verified_exact":30,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2606.03108."}