{"as_of":"2026-08-08T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e97098520d9fc732cd838985eb2e4333a790c69efeed5bb7f4b82cceb56cd632","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:53.840638Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02139/citation-record","integrity":"/paper/2608.02139/integrity","json":"/paper/2608.02139/citation-record.json","paper":"/paper/2608.02139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:14:51.628042Z","title":"InProceedings of the AAAI conference on artificial intelligence, volume 38, 17682–17690","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:51.628042Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:b33c296dc5985a276963329b435e817389663501c125e3a959bd8f9f4c0c0dbd","observation_id":"a86376f1-91ec-4e3f-a42a-ab7681d51475","resolution":{"observed_at":"2026-08-07T00:14:51.628042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T00:14:52.132451Z","title":"arXiv:2503.09516","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.132451Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:2f96f341c328ee5cb5316885d2a046c17eba1c6f4fbd489503896b0fdf1254c7","observation_id":"8ae55e69-9a49-4504-b1b4-43e0f52c452d","resolution":{"observed_at":"2026-08-07T00:14:52.132451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T00:14:52.433047Z","title":"Liu,N.F.;Lin,K.;Hewitt,J.;Paranjape,A.;Bevilacqua,M.; Petroni, F.; and Liang, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.433047Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:293e3ae3fcbb327f152d979030ebc74f91618164e22898ee00561a4d6820354b","observation_id":"7f9e970c-930a-4876-a105-f50ebe8d9dfc","resolution":{"observed_at":"2026-08-07T00:14:52.433047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-05T08:09:01.340423Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T00:14:52.493528Z","title":"arXiv:2401.08967","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.493528Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:92d7ef9d29c3c16733bf7e0d8418eecf82f9c5d70bee5984f612d1e768a531b4","observation_id":"fd8b029b-c614-420d-963a-c6901beb1782","resolution":{"observed_at":"2026-08-07T00:14:52.493528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:54.470307Z","title":"Mexico City, Mexico: Association for Compu- tational Linguistics","venue":null,"work_id":"28d431fe-b023-4112-a3e3-852cf72469fe","year":2024},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.584832Z"},"links":{"citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:663435b644252c68deb92a5eac9ca303c52fec8d45d000def799777e76922cb1","observation_id":"8ab77ad3-d340-48c2-8ca2-09ad79301ced","resolution":{"observed_at":"2026-08-07T00:14:54.527323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-07T00:14:52.667860Z","title":"arXiv:2602.04942","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.667860Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:e0956c4306bcf1b98538b0b2434380fb22e5d9b0fb6cf213c2b43cce350b81fa","observation_id":"17bae05d-6cd2-4496-a84d-ee2afd62df82","resolution":{"observed_at":"2026-08-07T00:14:52.667860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:14:52.737140Z","title":"arXiv:2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.737140Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:1b2604809663401feb2ccac4a779bd20ae289ea11f6b2188c4f6f378fc83421d","observation_id":"f931f582-dfb6-4887-89ad-1bd468f449cd","resolution":{"observed_at":"2026-08-07T00:14:52.737140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24064","last_updated":"2026-06-23T02:14:12Z","snapshot_observed_at":"2026-08-01T19:53:34.208327Z","submitted_at":"2026-06-23T02:14:12Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2606.24064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.24064","snapshot_observed_at":"2026-08-07T00:14:53.986060Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","venue":"cs.AI","work_id":"77b1489b-7eec-49be-a8e3-b7287ec35714","year":2026},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.852963Z"},"links":{"cited_paper":"/paper/2606.24064","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:4840dddf4b022a1771e1214b39cc5ba59a986704e128dfb5869a37ab4a38315c","observation_id":"bf57b854-9cf4-4a50-9db3-79684a2b7804","resolution":{"observed_at":"2026-08-07T00:14:54.057384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T00:14:52.945625Z","title":"arXiv:2009.01325","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.945625Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:d0d72ecd4341a585f3605b88375f9da772d84146946fb946cfa906ba6b74a508","observation_id":"cb45d8de-3697-4783-9d55-96d7e867809c","resolution":{"observed_at":"2026-08-07T00:14:52.945625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:54.322919Z","title":null,"venue":null,"work_id":"f14b3f1a-2e38-4a6d-95cf-0e0e84a45ba1","year":2024},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.053392Z"},"links":{"citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:d1ea0db2fc9d8af9f47fec48051a72af6d9d54f081322af2db807dfaaabfe619","observation_id":"6fc808de-7b5f-48e0-8ca0-15ed7ed9a7d0","resolution":{"observed_at":"2026-08-07T00:14:54.399597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T00:14:53.167075Z","title":"arXiv:2501.12599","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.167075Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:4d5507bea4135896fbea16248a7cdf9e6ff6070598a70a3d7a85b3707238efea","observation_id":"7ee965ff-f280-4811-a330-c9a58e959cee","resolution":{"observed_at":"2026-08-07T00:14:53.167075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-07T00:14:53.270921Z","title":"In2026 International Conference on Embedded Systems, Mobile Communication and Computing (EMC²), 301–306","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.270921Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:4eb25d47487a4ad8803e50c05ba85fd234de594522076249732840dae153432b","observation_id":"917f942a-4e44-4f62-9862-d96d96fa09b2","resolution":{"observed_at":"2026-08-07T00:14:53.270921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T00:14:53.385502Z","title":"arXiv preprint arXiv:2203.11171","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.385502Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:4ca77f491941ab10045a9c068448ce55af50b9686234aa02ba4873ff5637a73b","observation_id":"ae2fa355-1d36-42e6-b2c9-856a172610a1","resolution":{"observed_at":"2026-08-07T00:14:53.385502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T00:14:53.476750Z","title":"arXiv:2504.20073","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.476750Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:aeb43ddac226a58dc4d7296e430a476110d14fcb95bf16b08baa19e474b0b2d6","observation_id":"90a4fbce-1e03-4d14-8fca-69c32febfd6f","resolution":{"observed_at":"2026-08-07T00:14:53.476750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T00:14:53.569449Z","title":"Yu, Q.; Zhang, Z.; Zhu, R.; Yuan, Y.; Zuo, X.; Yue, Y.; Dai, W.; Fan, T.; Liu, G.; Liu, L.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.569449Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:af1785fc6746991ffe88a9137ab2c3d9dd4ffdd15040d4d0fd2e8ce755287bb7","observation_id":"552e9929-b0b7-4a2f-a4b3-f196aa85df3c","resolution":{"observed_at":"2026-08-07T00:14:53.569449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:54.211375Z","title":"Expel:Llmagentsareexperientiallearners","venue":null,"work_id":"8c6929f1-ebbc-4c99-8379-6d9ba0f8a484","year":2024},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.661199Z"},"links":{"citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:b1ce60fd0b1d514c2c03932cafd81f93f99f9efcf324c2cd6545b21ad4d038fe","observation_id":"69d5ac64-ecc7-4360-ad19-e41cc7ad756c","resolution":{"observed_at":"2026-08-07T00:14:54.242192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-07T00:14:53.742184Z","title":"arXiv:2601.18734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.742184Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:48ef65cecda14971a2f3faffe91eb67660ef0e5af87c5d5ec5df3a63bf30aa35","observation_id":"6884dd0e-b56d-48ac-b1f8-b0a7828cbbea","resolution":{"observed_at":"2026-08-07T00:14:53.742184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:14:53.840638Z","title":"arXiv:1909.08593","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:53.840638Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:67dc5df8088f1f1ab8c315f0f8b0213e70f4c3ebcc786b5fdabb67d666268c84","observation_id":"f922c2e8-bb6f-4c45-8aeb-fe438a28dee5","resolution":{"observed_at":"2026-08-07T00:14:53.840638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T00:14:52.018406Z","title":"arXiv:1503.02531","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.018406Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:e9b4c995f2f10ee4794f85c102c84ba323cc012fa9fa6a3f988f9183e54a1e27","observation_id":"3d7fd242-6134-4c8c-87ed-4cc0e74efd5a","resolution":{"observed_at":"2026-08-07T00:14:52.018406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T00:14:52.247773Z","title":"arXiv preprint arXiv:2001.08361","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.247773Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:5f54e056fc790e68d0ae233bb43072e564d20e027c64b93752fe7af71feb50f5","observation_id":"936ce180-9f81-4839-9535-6323bcc33898","resolution":{"observed_at":"2026-08-07T00:14:52.247773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-06T05:06:31.977572Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-07T00:14:52.339631Z","title":"arXiv:2207.01780","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.339631Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:fd38f75f873a659e1b556df70d2cb896540d66e8174de54f7d79b239164f8ee7","observation_id":"4058ba69-5813-41c8-83de-99ec992faf60","resolution":{"observed_at":"2026-08-07T00:14:52.339631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:14:51.435355Z","title":"Agarwal,R.;Vieillard,N.;Zhou,Y.;Stanczyk,P.;Ramos,S.; Geist, M.; and Bachem, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:51.435355Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:bbf484110fad0dda6a6781267a67aa1a8681e9aa390e66c550a8770cdd6d8647","observation_id":"1261451e-4e58-4460-b123-6dab728803a0","resolution":{"observed_at":"2026-08-07T00:14:51.435355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-07T00:14:51.525171Z","title":"arXiv:2306.13649","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:51.525171Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:b79cd4ad8b66d195aa7d83fc42490af631dafb590a5246eb46c5dfb4933f9302","observation_id":"562d20f0-28e4-49f3-a75b-25b9f7dc0ce7","resolution":{"observed_at":"2026-08-07T00:14:51.525171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:14:51.898510Z","title":"Hinton, G.; Vinyals, O.; and Dean, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:51.898510Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:3246f2a9fe3f5bfe5efb670e923c64dc5dcba9dca39b8af9c9dcdac470c42009","observation_id":"e3dc3a32-dfd4-493b-91d6-fa61925135e4","resolution":{"observed_at":"2026-08-07T00:14:51.898510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-07T00:14:51.747842Z","title":"arXiv:2306.08543","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:51.747842Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:ea398cf33c9dfea1f4a531ad8ce1e808bfedb51f30df35bc238f6eb287e289f2","observation_id":"4c0bdd01-606b-4211-8a2b-71f6b2bf37e1","resolution":{"observed_at":"2026-08-07T00:14:51.747842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T03:43:48.666561Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.02139."}