{"as_of":"2026-08-07T22:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13af5e66e1a416b0723415d1bc536dad31198e11039abbd4a729081a471478d9","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:40.426831Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:41:42.259895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.690995Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2507.13334","last_updated":"2025-07-21T17:48:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T17:50:36Z","title":"A Survey of Context Engineering for Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T20:58:45.060041Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2507.13334"},"observation_digest":"sha256:abd618a10f6c021cac035fe86f45f38b1a623785d93554fbea1c3d1665538d86","observation_id":"a667597f-34d6-4b4d-9ba0-6732f76f3c75","resolution":{"observed_at":"2026-05-13T20:58:45.141925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2508.13654","last_updated":"2026-04-21T03:24:34Z","snapshot_observed_at":"2026-08-04T00:45:12.282530Z","submitted_at":"2025-08-19T09:04:13Z","title":"Input-Time Scaling: Adding Noise and Irrelevance into Less-Is-More Drastically Improves Reasoning Performance and Efficiency","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T22:42:53.663354Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2508.13654"},"observation_digest":"sha256:537285a6c76720f852e46671675ec0e3c8d51ea5a38419e012c965b9550c95d3","observation_id":"4ce0801e-0b98-4eb3-a5ea-bb705d2d323a","resolution":{"observed_at":"2026-05-18T22:46:53.907850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2509.21743","last_updated":"2026-03-31T22:32:08Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T01:17:35Z","title":"Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T13:42:07.883909Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2509.21743"},"observation_digest":"sha256:fc369ed09b162ad8d1b52e47de17753aef5ca0bbcb8a60cd10281a232bd75f41","observation_id":"cebbe30e-d707-4075-8231-559d79d3907a","resolution":{"observed_at":"2026-05-18T13:42:38.721025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-08-04T12:41:42.259895Z","title":"10 Preprint Shelly Bensal, Umar Jamil, Christopher Bryant, Melisa Russak, Kiran Kamble, Dmytro Mo- zolevskyi, Muayad Ali, and Waseem AlShikh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02919","last_updated":"2026-05-29T16:16:27Z","snapshot_observed_at":"2026-08-07T08:42:12.238625Z","submitted_at":"2025-10-03T11:46:04Z","title":"Self-Reflective Generation at Test Time","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T12:41:42.259895Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2510.02919"},"observation_digest":"sha256:9a5848fe02d504b55e263f9e306b1bf94185e1a89d0c90f6c3495eac745c0144","observation_id":"be380109-018d-4b57-8c52-e97617f69d9d","resolution":{"observed_at":"2026-08-04T12:41:42.259895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":288,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:9c3b419ce1d93820fbd485abe63e15232899f73f2d8d6140bf1ae092cf5fb7a3","observation_id":"2c6e74c5-d46e-4cb1-afb7-3b1f56757a43","resolution":{"observed_at":"2026-05-17T15:14:26.410357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:c620e7fade2b4afbbc2d106cb40c8ad9e38483ec9790339d27e563e9e9e8d4a0","observation_id":"afb29695-d9ba-4290-944c-d6dcef50184a","resolution":{"observed_at":"2026-05-12T08:06:31.794258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:769ba2ed00d3e64430f22169ff640587f70b648aabec4400a0286e9c786ae4b0","observation_id":"b762b6cf-007e-4468-9520-1324bb89998d","resolution":{"observed_at":"2026-05-19T18:07:42.262051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:23.895430Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:4a6e60413a4996f829efbde1ae42634631a3301d9bfa4a65942c4f03a009a079","observation_id":"d6678781-0785-4e35-aee2-0c6a59a5bc0b","resolution":{"observed_at":"2026-05-12T06:01:25.376226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:49.322744Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:2e5f57a3cc9e7ad7e4b76f343bddd6142385e35c8aa86ea1a29b1c97a178b0d4","observation_id":"b2731606-a626-4501-b535-cf4aa6885698","resolution":{"observed_at":"2026-05-20T22:49:10.314539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:8c706861b11b42981086c21e2c486c9a71adbe2d5cf6c003b55c0f777c714cbf","observation_id":"d07f7d49-830e-40ee-9429-65ec56ffab8a","resolution":{"observed_at":"2026-07-01T20:56:13.720223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-05T23:10:47.877661Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:34.199607Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:ff482ca1f0fd9485efc2d78efe06dfcead3df649aa00bc3054f0f4076937846d","observation_id":"dd02e5db-fb1c-4588-b3fd-7b9a18e0a419","resolution":{"observed_at":"2026-07-03T15:08:33.453282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-08-03T02:12:16.219670Z","title":"Bensal, U","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-05T23:10:47.877661Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:16.219670Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:c266a7597494591359523bd444cedc04a5a5dd0647add1c05bdc67bcd57fe4eb","observation_id":"7134ada1-c2e2-46d9-9fa5-bf9de84df25e","resolution":{"observed_at":"2026-08-03T02:12:16.219670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Reflect, retry, reward: Self-improving LLMs via reinforcement learning.arXiv preprint arXiv:2505.24726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:53a0988c5c33796d190abf54aada12e1d0d8a5a40c868e493ec39f2f83202299","observation_id":"959d28d3-e55a-4719-a13c-ac9a3d57164b","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:0bc3fa13e21cda35c90ca4d93af7f2f374a8c10b9898dc273e11d88073919610","observation_id":"cd2f4927-bba8-4ab2-b334-9ce615378880","resolution":{"observed_at":"2026-07-08T00:04:22.692261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2505.24726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:18af4fb17d66c4773f84fa7055083a2b5c041ab37db1a3af3ed1436d3395c771","observation_id":"782637b5-80bb-422a-9834-55f9aa088fb6","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24726/citation-record","integrity":"/paper/2505.24726/integrity","json":"/paper/2505.24726/citation-record.json","paper":"/paper/2505.24726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:34.861649Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:34.861649Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:34489af18329dccedf5f80b210a626e4f297563536cc30d24100c66407afcabf","observation_id":"9b9ff29d-d9cf-4137-85b9-8e79fd5e86f0","resolution":{"observed_at":"2026-08-07T12:35:34.861649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:34.960301Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:34.960301Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:78d063baf6c7f2b8cbafaf1ad08284903ffb6af852b5cf0fec8670ab0c1a60b1","observation_id":"5c883d1e-40c5-4807-8656-7b743d85b4b3","resolution":{"observed_at":"2026-08-07T12:35:34.960301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:35:35.083696Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.083696Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:046f88cc5860a6d7dd853e9426c4d6e440eccae331b34956ec4da548aa644e51","observation_id":"3b2dcd2d-6c02-4f85-9673-068e45be6863","resolution":{"observed_at":"2026-08-07T12:35:35.083696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:35.259812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.259812Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:82100b3ddda20e4a6f72368800aa50e1c98257b90560d9dd5e4fcbf9adce8d36","observation_id":"956def62-0880-44ac-8938-04c0604a95dc","resolution":{"observed_at":"2026-08-07T12:35:35.259812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.starsem-1.22","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:40.636013Z","title":null,"venue":null,"work_id":"f9542f79-beb8-4703-bf10-70d84c2d1e7f","year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.409519Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:265e10c59f2eb4f6c9c79558322949637385db9df099f6d7c2f014dbfd9ebab3","observation_id":"3023ca1a-1ca2-48b4-bb0b-26130eaf3afd","resolution":{"observed_at":"2026-08-07T12:35:40.840220Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T12:35:35.568647Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.568647Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:eb316f60ef4fa4e864086112cf110036cfe59cf4271f0e62db2728904894735c","observation_id":"1a66e9ab-d617-413c-829c-94811bb8051b","resolution":{"observed_at":"2026-08-07T12:35:35.568647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:35:35.832113Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.832113Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:79ca0616342e4eaf7831f1af8277cbad6d9f90b6fe2dfb068bfbf359c18762a2","observation_id":"63f1c250-c8ee-4e31-b444-9d6d0efdd326","resolution":{"observed_at":"2026-08-07T12:35:35.832113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11001","last_updated":"2025-04-15T09:18:21Z","snapshot_observed_at":"2026-08-07T16:05:35.928009Z","submitted_at":"2025-04-15T09:18:21Z","title":"ReZero: Enhancing LLM search ability by trying one-more-time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11001","snapshot_observed_at":"2026-08-07T12:35:35.992263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.992263Z"},"links":{"cited_paper":"/paper/2504.11001","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:74577a440bc83a3f80c36442e3c2ab03bb402eb1b2ffe106faa684473eaeee7e","observation_id":"48c8d135-793a-4674-80d6-dc6505968bc6","resolution":{"observed_at":"2026-08-07T12:35:35.992263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.205203Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.205203Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:b6d7313e3d3758a1d619826bc3032af00d5ceb87a6ef83971811a1fbfc9167c0","observation_id":"5889e0bd-b0e3-4df6-9ed9-b9dcd554087d","resolution":{"observed_at":"2026-08-07T12:35:36.205203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:35:36.351366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.351366Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:887a54005d4e142783b70d3c1b3340e7497a04036d70114f9e68c49d75bc25ff","observation_id":"53714535-dfd3-4a37-967c-cf26cc185c26","resolution":{"observed_at":"2026-08-07T12:35:36.351366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.415581Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.415581Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:204aef2a62df2c15e0a498b60da5202523b4a2bf847b9b5a36f82b697e840d1f","observation_id":"34b6c8ef-a99b-4405-a181-c033fad9e685","resolution":{"observed_at":"2026-08-07T12:35:36.415581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T12:35:36.557807Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.557807Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:babe773b4312d6ae4953e213f8435b0c76cd3ee9717cadbdb0923c3e9b642e7d","observation_id":"1ee72f43-7db4-4f1a-a9df-fdfd65ad5220","resolution":{"observed_at":"2026-08-07T12:35:36.557807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.636735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.636735Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:06ac9635dc0f88b28fb6f7589868a3f438aca21a43cc45902e127f1a1fa7716e","observation_id":"01b10b17-ef42-4ad3-8070-76876adfe558","resolution":{"observed_at":"2026-08-07T12:35:36.636735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.738019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.738019Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:c477c0fa7f9ef0d135cde8549ee07d1e57afbf4d8d4dca76499a26458dcc4080","observation_id":"09642e74-6af0-4d90-8c7c-a9d1a5ee1eac","resolution":{"observed_at":"2026-08-07T12:35:36.738019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:43.022852Z","title":null,"venue":null,"work_id":"c49ab486-5442-45d5-a2d5-d6477fbbc620","year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.863086Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:30b18028fc16e7daf590184bdc48a3e9662ebf760457fd749f14da5cbd49fcc0","observation_id":"c7878b40-7727-4454-98d5-0f3700fc303f","resolution":{"observed_at":"2026-08-07T12:35:43.087654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.957944Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.957944Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:0c9d1726d79f57335bda67a4e402fa0be7c4b56d907f45c1bd4bbba53397dcf4","observation_id":"53328d92-8663-4c04-81a8-1470c472d2c5","resolution":{"observed_at":"2026-08-07T12:35:36.957944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T12:35:37.056537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.056537Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:87afba558acd3f1434eeaf5e10599f485c65eead860cd0d70807eed51c974d44","observation_id":"9e2e5de6-cd90-47f5-b1d6-7060f75b29d5","resolution":{"observed_at":"2026-08-07T12:35:37.056537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.174034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.174034Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:9edf1ae74d9796f478a0067af7a117b8c4caba38c005291b66b753b63cad8c09","observation_id":"04d92912-ce03-4e3f-8e69-d21f4706a7bb","resolution":{"observed_at":"2026-08-07T12:35:37.174034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10105","last_updated":"2024-04-14T01:15:31Z","snapshot_observed_at":"2026-07-06T16:20:13.025092Z","submitted_at":"2023-09-18T19:28:48Z","title":"Understanding Catastrophic Forgetting in Language Models via Implicit Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10105","snapshot_observed_at":"2026-08-07T12:35:37.237089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.237089Z"},"links":{"cited_paper":"/paper/2309.10105","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:96592ae82030455b136b2ee9b7a68b8ba5746d02ce9bca580abd35aad50826dd","observation_id":"1541ad01-913f-4259-a889-09f58ef76593","resolution":{"observed_at":"2026-08-07T12:35:37.237089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T12:35:37.311069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.311069Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:f287a0abc255c4da8ce32daac4e85df118ddbbf097399b134171bf520d4213b7","observation_id":"7fe7c305-c796-4728-8633-132075ffb7a0","resolution":{"observed_at":"2026-08-07T12:35:37.311069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.411678Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.411678Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:fb4d65ceb6ee7f6b12ce66b5736f8b482964d7ec36c3aca0b1aae7efc9e4a21c","observation_id":"5cbfd8cb-edec-4ca0-8209-690b52d2dfc7","resolution":{"observed_at":"2026-08-07T12:35:37.411678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:35:37.503027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.503027Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:8bf8d3228d2b8b784db268386c9ccc67b6fca27c53f027becb9696bee072cd76","observation_id":"0b82f9e9-4aab-4d41-aa95-17b48f455999","resolution":{"observed_at":"2026-08-07T12:35:37.503027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.811261Z","title":null,"venue":null,"work_id":"43fa2b8c-e0e2-4f1c-b0ea-50a4d04bdaea","year":2016},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.598472Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:dce15db7d7fcf19a794c560af6e164cf4c1c1252831bf379e1c5cb92632c6aaa","observation_id":"d4b09f2b-dbd3-4689-bafb-059b08b030d2","resolution":{"observed_at":"2026-08-07T12:35:42.897758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00902","last_updated":"2025-03-02T14:02:03Z","snapshot_observed_at":"2026-08-07T17:35:51.608720Z","submitted_at":"2025-03-02T14:02:03Z","title":"Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00902","snapshot_observed_at":"2026-08-07T12:35:37.669914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.669914Z"},"links":{"cited_paper":"/paper/2503.00902","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:ea69e79ec4b14c9e07abbe738bc7205ce32ddca57dc2364987c1819646285e1f","observation_id":"3576f0f6-14d8-4d0b-b505-566183825cff","resolution":{"observed_at":"2026-08-07T12:35:37.669914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.558597Z","title":null,"venue":null,"work_id":"8beee9f5-0da3-4b60-a4e3-e54014d277ca","year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.756243Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:267c51ea3dfd5d473a9d7f2f556fe1bfd3f4af292a9cd1bc2a57bb6b19c4d8ec","observation_id":"9997fed6-014f-4fa3-862a-65087ae21702","resolution":{"observed_at":"2026-08-07T12:35:42.649406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.309163Z","title":null,"venue":null,"work_id":"7cb850e2-846e-4966-a538-1a9b36046861","year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.873250Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:b1a8a90f92941f4fa4ed81b203d589e457754eb11ff437331928336bb0935492","observation_id":"11ae6f74-d7e9-4c7b-a813-6b023325a1f7","resolution":{"observed_at":"2026-08-07T12:35:42.400357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.139734Z","title":null,"venue":null,"work_id":"fa89daf9-e568-4884-bfda-0be50f04c7d6","year":2017},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.976934Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:795ba97866122fc118313522da622862132405caef2f90ff3e52adbdc87e592b","observation_id":"7c946d2e-a0a2-42c5-aa15-3cf6328d92dd","resolution":{"observed_at":"2026-08-07T12:35:42.207703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.088525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.088525Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:b0c3bd725dcb5b314d383fa7aa17a29f84404e5bfb0a1b53968cb04e09f1dc16","observation_id":"97e5b161-4742-443a-ae01-c04c694f00b6","resolution":{"observed_at":"2026-08-07T12:35:38.088525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15466","last_updated":"2025-08-17T18:23:42Z","snapshot_observed_at":"2026-08-07T16:00:25.971897Z","submitted_at":"2025-04-21T22:29:02Z","title":"Learning Adaptive Parallel Reasoning with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15466","snapshot_observed_at":"2026-08-07T12:35:38.172948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.172948Z"},"links":{"cited_paper":"/paper/2504.15466","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:3f026503c0fbe1f4dad0c02725c7494d50ee62b31ff2d2faafdbeb57b8c91c95","observation_id":"aa751dfe-6a10-4d89-a3c1-a93ec7d09798","resolution":{"observed_at":"2026-08-07T12:35:38.172948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:41.984314Z","title":null,"venue":null,"work_id":"85195b57-0199-46a4-b3f1-5aec437bfaee","year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.271932Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:e482ee9af3c2ea74eb9e260d4d7b922b15dff5fb0ada6d98146b9785736ef4a6","observation_id":"983b2f28-0bfc-438c-865e-fa5d93f2dacd","resolution":{"observed_at":"2026-08-07T12:35:42.055686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17439","last_updated":"2025-05-30T15:19:51Z","snapshot_observed_at":"2026-08-07T16:45:50.800051Z","submitted_at":"2025-03-21T17:59:10Z","title":"LEMMA: Learning from Errors for MatheMatical Advancement in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17439","snapshot_observed_at":"2026-08-07T12:35:38.363254Z","title":"Vicky Zhao, Conghui He, and Lijun Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.363254Z"},"links":{"cited_paper":"/paper/2503.17439","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:a793bc36344162f6edf2b9bab93f91ffda93ed417dba91d872b6e2f61432d598","observation_id":"75b95565-6a73-42ce-ba8a-5f485c757876","resolution":{"observed_at":"2026-08-07T12:35:38.363254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12813","last_updated":"2023-03-08T23:41:49Z","snapshot_observed_at":"2026-08-06T18:27:41.688063Z","submitted_at":"2023-02-24T18:48:43Z","title":"Check Your Facts and Try Again: Improving Large Language Models with External Knowledge and Automated Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12813","snapshot_observed_at":"2026-08-07T12:35:38.436062Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.436062Z"},"links":{"cited_paper":"/paper/2302.12813","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:8436b1532d629ea1496b5c67164905f06958ee9d88e19cd8c56b4d8301ed36e6","observation_id":"c7cecc57-05b5-467a-9235-e4fba1d354e0","resolution":{"observed_at":"2026-08-07T12:35:38.436062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T12:35:38.568666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.568666Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:6773962ef3d1de6bfe0287d5f271406ccc8d4a57c5335281b72c7e0a0e19ec0f","observation_id":"c23a9c6e-29a7-488d-bae5-93536a9ba9a9","resolution":{"observed_at":"2026-08-07T12:35:38.568666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-07T12:10:53.303603Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-07T12:35:38.675580Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.675580Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:799be84837913589a4311417f4ff937117e406322e80e41b8ba90523e056bf71","observation_id":"8bccfb7d-e822-47f3-92ed-c01937437e1c","resolution":{"observed_at":"2026-08-07T12:35:38.675580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06682","last_updated":"2024-10-16T23:19:46Z","snapshot_observed_at":"2026-08-07T21:53:38.296252Z","submitted_at":"2024-05-05T18:56:46Z","title":"Self-Reflection in LLM Agents: Effects on Problem-Solving Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06682","snapshot_observed_at":"2026-08-07T12:35:38.889507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.889507Z"},"links":{"cited_paper":"/paper/2405.06682","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:db8d7c73a885365242bea5ad7e183d431b21c08be502bf19da94ed54a16393b9","observation_id":"275de774-9fe7-4dc6-af7f-7a46307ec865","resolution":{"observed_at":"2026-08-07T12:35:38.889507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:35:38.941943Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.941943Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:432a88783c9c7b9acad787f9ecee0b3feacd01fc3eac41da11fb503c09137a01","observation_id":"9942cffa-1630-492b-ad08-7bf151dd11b5","resolution":{"observed_at":"2026-08-07T12:35:38.941943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:35:39.013972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.013972Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:9c345d2ddf37b3cd18d5e79f1b4380e94cb47c658dd2a0b9157b91a80e371dcc","observation_id":"d2bd7e0c-e0c2-415c-a0dc-b67d52b03bb1","resolution":{"observed_at":"2026-08-07T12:35:39.013972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.089985Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.089985Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:c04bf3865e590282e51368ee1196ab25bd7065c5eab1003c827589d1d70ffc9c","observation_id":"77215a42-c208-4c9c-9949-fae72e537a42","resolution":{"observed_at":"2026-08-07T12:35:39.089985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.164960Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.164960Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:5c2d6d0f868c6df23b21f35c6180246d586c6fa9a638a2a024c9ee26200d521c","observation_id":"3ee18af6-9c36-4fb0-8713-0e60c8d392b2","resolution":{"observed_at":"2026-08-07T12:35:39.164960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-07T12:35:39.242501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.242501Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:febe587c2bf92586d78a452fad5956173934e9dfd718f2f5c931753cc3e3501c","observation_id":"02844c99-a114-41f7-9d76-a1a08b570bf3","resolution":{"observed_at":"2026-08-07T12:35:39.242501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:41.738242Z","title":null,"venue":null,"work_id":"ec0d0b12-f1f7-4854-b6c7-2785317891c0","year":2022},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.320511Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d2eed8eea5a57a0b9954e77c4676128645dee728e98508f791c1b5520e86859c","observation_id":"b3709454-5482-4e16-bde9-04e5fbf14a8e","resolution":{"observed_at":"2026-08-07T12:35:41.839084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:41.549292Z","title":null,"venue":null,"work_id":"e6fde96e-e476-452d-a581-45d2d9571e94","year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.427431Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d25d82080fb9b443c612e0ad3d1b88ed3ace2ac38850e1c8de63717d1e1f3ad4","observation_id":"475ad1e2-c136-4ea0-b489-30e396a9f81a","resolution":{"observed_at":"2026-08-07T12:35:41.639978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10827","last_updated":"2025-05-25T18:05:14Z","snapshot_observed_at":"2026-07-06T20:07:01.648579Z","submitted_at":"2024-12-14T13:12:50Z","title":"Rethinking Chain-of-Thought from the Perspective of Self-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10827","snapshot_observed_at":"2026-08-07T12:35:39.496054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.496054Z"},"links":{"cited_paper":"/paper/2412.10827","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:c5795bb1cd62d6898265958feb9201a17db75d98671be736dccc60a10b243b42","observation_id":"7a3a9574-7702-447c-a809-de5cd05f0aa2","resolution":{"observed_at":"2026-08-07T12:35:39.496054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T12:35:39.602927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.602927Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d904eee39007529404f9f2e0fb5c9621c4b9d1d8eccae0f6f28307999ec139ae","observation_id":"bb982c97-2962-40af-9879-54a35a1185f1","resolution":{"observed_at":"2026-08-07T12:35:39.602927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:35:39.687345Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.687345Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:c5d3f93980fad9b081b29a00e4a3d59befa618eb68decad17d6310befb63acad","observation_id":"c7abd710-2915-4279-ab23-728769dfb765","resolution":{"observed_at":"2026-08-07T12:35:39.687345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.783549Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.783549Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:dc9cce59f96d927af8b536e6d4563e5f2ff35e7dc6430cfcf87843fc471ba286","observation_id":"a2b04294-cced-44c2-8898-8f13660ec3aa","resolution":{"observed_at":"2026-08-07T12:35:39.783549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T12:35:39.880812Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.880812Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:5e7613c726af09bb8de7f975baf2df2b1d1b3be292e3bbc5ac41931431d95cd5","observation_id":"96df79b1-acab-4ed4-830e-2ec77e7bd15d","resolution":{"observed_at":"2026-08-07T12:35:39.880812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.948340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.948340Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:e8206436d88a17cdd70dd8633e5c9505a446df95eb4c5f8a0278d88182163990","observation_id":"6d3e9429-4f9e-46dd-87b8-9618be2330e3","resolution":{"observed_at":"2026-08-07T12:35:39.948340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:40.097436Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:40.097436Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:edcee3820d200fc69fb4d6c44fa1bc049bf2c1eec419b936ef2ac645ee9515b4","observation_id":"b7da77fb-c34e-461d-a598-28986c3a01e3","resolution":{"observed_at":"2026-08-07T12:35:40.097436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T12:35:40.252367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:40.252367Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:b36b81fc64bfcded517e2c196f4638030c12f040a57e4703d0d06902a688f579","observation_id":"3a4318b2-588c-4f1c-a06d-79e89cc600a5","resolution":{"observed_at":"2026-08-07T12:35:40.252367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:40.426831Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:40.426831Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:3d48e77a0b5a729e59c159eb2ffe9690fb7e8e6e88d2663d3250e9671c1aff22","observation_id":"993c7cac-ac4c-4875-8537-9b21c8d774d0","resolution":{"observed_at":"2026-08-07T12:35:40.426831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 15 inbound Pith citation observations for arXiv:2505.24726."}