{"as_of":"2026-08-07T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99d4a0acf70000f50d92f9c209e6b65c7c2c7b040a7eb8ae0971e32b8c0717a0","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:27.149715Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:39:47.889405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:49:02.982506Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-08-05T11:39:47.889405Z","title":"No free lunch: Rethinking internal feedback for LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02401","last_updated":"2025-09-02T15:12:10Z","snapshot_observed_at":"2026-08-06T15:33:33.913142Z","submitted_at":"2025-09-02T15:12:10Z","title":"Towards Agents That Know When They Don't Know: Uncertainty as a Control Signal for Structured Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T11:39:47.889405Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2509.02401"},"observation_digest":"sha256:c5268bd2fdc39cde8a5deb75d55e34ab6ce4d506999c7fc593d31a3486e4c1de","observation_id":"c31aded5-24be-4437-bcd2-3240d11e67b6","resolution":{"observed_at":"2026-08-05T11:39:47.889405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2509.05489","last_updated":"2026-04-16T20:13:16Z","snapshot_observed_at":"2026-07-06T22:24:51.648354Z","submitted_at":"2025-09-05T20:39:43Z","title":"Self-Aligned Reward: Towards Effective and Efficient Reasoners","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-18T18:27:23.076544Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2509.05489"},"observation_digest":"sha256:95393c8e6a92048b6a799a0be305911588edd4d9df122ed63db62caa4c3a000d","observation_id":"a355802a-b5ca-4911-8a28-4adf17f38350","resolution":{"observed_at":"2026-05-18T18:31:44.441162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-08-04T16:07:47.645599Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:47.645599Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:513b6d158ef0e02751018bb24d0d537efe15a7300fc3438d49168a3b20bd4325","observation_id":"7dbf4b0e-705b-45b0-8083-43c8ee33bce4","resolution":{"observed_at":"2026-08-04T16:07:47.645599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-08-04T10:44:32.329818Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-06T09:42:32.578654Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:32.329818Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:de71e646d51042f7188359d8b25f0f64082fbb9ca7de5a50a05b9d18f48be542","observation_id":"40c57f60-d892-462b-a512-4717ad7896b5","resolution":{"observed_at":"2026-08-04T10:44:32.329818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:915d033c3111ed2f5413def5d72f928cbe428c7965483d966ccd7250d28e712e","observation_id":"2848b1e9-59ce-4b6b-b311-091eed1c6631","resolution":{"observed_at":"2026-05-25T07:26:41.639859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2604.17501","last_updated":"2026-04-19T15:43:20Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T15:43:20Z","title":"CoAct: Co-Active LLM Preference Learning with Human-AI Synergy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:26:18.163720Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2604.17501"},"observation_digest":"sha256:8ae5d409e29568b84e5fb71faaae0c597209fad9dc6f1f7151babcbf89c9d5f3","observation_id":"0fb45e22-e0be-4aff-bd9a-39337a2a47f8","resolution":{"observed_at":"2026-05-10T07:01:49.591729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2605.04065","last_updated":"2026-05-07T04:49:30Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-11T07:26:04Z","title":"Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-10T16:58:10.013475Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2605.04065"},"observation_digest":"sha256:bac512c33aa6c21df53ccea7c579a5fe1977643301630c36ec1e1fba47f54ce2","observation_id":"52c9872f-c47e-458d-8c82-67b508e515b3","resolution":{"observed_at":"2026-05-11T07:45:59.869754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:e943b04829df6c4aba5337e9cac85755863f3803c9367f1ebef926b3b6a483a6","observation_id":"9672e61c-fb56-47ed-8f38-3c53997e1484","resolution":{"observed_at":"2026-05-11T04:00:55.150433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2605.17037","last_updated":"2026-05-16T15:16:00Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T15:16:00Z","title":"D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-19T20:21:48.657926Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2605.17037"},"observation_digest":"sha256:2421e8580cb644af46a0ffc3227c1610e7084017710d72b98aaf41753399d9bc","observation_id":"eb793416-eb9a-43c6-a989-8f187363629e","resolution":{"observed_at":"2026-05-19T20:22:45.275081Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2605.19444","last_updated":"2026-05-27T03:12:51Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:58:44Z","title":"Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-20T07:20:50.835826Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2605.19444"},"observation_digest":"sha256:7297be28e2bf5ab873a74e4165cb200aab94377ef63b290a1b2810d19b2a4ccb","observation_id":"3b80e509-f985-4f97-8f1d-80f17f5e2a4d","resolution":{"observed_at":"2026-05-20T07:23:06.906304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:98b57c5a2661e8f82c43ba9f300ee4f8b733bec16c2898a2e8e62806d05847cf","observation_id":"a47f0fb5-0084-4b81-8874-201806c4e10a","resolution":{"observed_at":"2026-07-01T20:56:13.695375Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:fd59e475fc6a641fd4bc963ef8f90e435b1c7a378df600e67c63a173df2c1c76","observation_id":"48d91114-c729-4d3c-8c56-81760641e3dd","resolution":{"observed_at":"2026-07-02T06:06:40.849490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2606.17803","last_updated":"2026-06-16T11:27:28Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:27:28Z","title":"Continual Self-Improvement with Lightweight Experiential Latent Memories","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T01:56:44.269388Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2606.17803"},"observation_digest":"sha256:89383aaf350cff4f36649f10dcb22cbba47b4d5fa8dfdcc7bbbd9f247477f3d0","observation_id":"bcbf05a3-fd56-4b0d-8577-c58130cfd916","resolution":{"observed_at":"2026-07-03T19:18:54.832730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17219","snapshot_observed_at":"2026-07-03T23:49:02.982506Z","title":"No free lunch: Rethinking internal feedback for llm reasoning","venue":null,"work_id":"5183a28c-7a97-485a-9466-c117c2e92779","year":2025},"citing_paper":{"arxiv_id":"2606.18961","last_updated":"2026-06-17T11:42:01Z","snapshot_observed_at":"2026-08-06T13:00:47.933590Z","submitted_at":"2026-06-17T11:42:01Z","title":"Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T21:40:55.946788Z"},"links":{"cited_paper":"/paper/2506.17219","citing_paper":"/paper/2606.18961"},"observation_digest":"sha256:906709eca3185b0e46cc69cc9eeb2471c9c753db3b7b0a5adba9d9df1f8361f8","observation_id":"16f175c8-4cf7-42f1-9910-af1ac9887390","resolution":{"observed_at":"2026-07-03T23:49:02.984144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17219/citation-record","integrity":"/paper/2506.17219/integrity","json":"/paper/2506.17219/citation-record.json","paper":"/paper/2506.17219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:28.851666Z","title":"Agarwal, S","venue":null,"work_id":"b83dc0ca-f43b-4341-8341-8f3938186363","year":2021},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:22.779816Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:032834b770f0d9e340600647331179df71ee8c541f30c1258b51d5807bb04d75","observation_id":"dfd4a66e-a357-4b88-a12e-b6346ec93a34","resolution":{"observed_at":"2026-08-06T23:35:28.904398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:28.676426Z","title":"Agarwal, Z","venue":null,"work_id":"1ba7aee9-62c2-4e33-b572-71d5d89fc67e","year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:22.846986Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:5403a03b0a5c3364b3cf25ecb00f4255a508d0057015b18055236964d003189b","observation_id":"926b5f14-6525-4f7f-9785-37760aea34a6","resolution":{"observed_at":"2026-08-06T23:35:28.789696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T23:35:22.932426Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:22.932426Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:e46b4b629df735f9febade879883297e963a65f23c34a6d98b1b139ec7bc9e90","observation_id":"f8e4d7f2-e6dc-4b2a-be7c-528477446a5e","resolution":{"observed_at":"2026-08-06T23:35:22.932426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:28.478814Z","title":"Balunović, J","venue":null,"work_id":"cdbd5064-ab72-4f16-8981-486d0097a969","year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.008938Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:95bcdd0eaf68d6ad3d3f6e7661ed376a07648b36c5a7647dce17f72b27bf9225","observation_id":"e16d01a8-ccf6-4941-a2b3-ab8c6000985f","resolution":{"observed_at":"2026-08-06T23:35:28.610515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:28.326641Z","title":null,"venue":null,"work_id":"1b62494d-db12-4c9a-ba6b-d4e76cb4378b","year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.105094Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:6f6b6bec16c1a04b449c7f6430553d836c94de6d78c27b345c86e083bfc5c64b","observation_id":"cfbe4d4c-bfc8-488e-a31a-12c7f52c6c82","resolution":{"observed_at":"2026-08-06T23:35:28.379368Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:35:23.230151Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.230151Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:5f5aa558f2accc0bb0b46f7174660a15865180456dbfd4ac9d5e97cc1317c0cd","observation_id":"50404a3b-569f-4601-8971-c42fbf504402","resolution":{"observed_at":"2026-08-06T23:35:23.230151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-06T23:35:23.326805Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.326805Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:f56defeff9aeec2ac8b5ca6cf5a51617525d9fd88fde76c6c07cd415c1cf8f57","observation_id":"6614c350-9651-4508-8e8c-e2f073e6c23d","resolution":{"observed_at":"2026-08-06T23:35:23.326805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-07-06T21:30:52.246162Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T23:35:23.466690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.466690Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:715a723d80c1f1685807cb1ef13bb350c05be26db6c3a14f2e50fdbbaee203cd","observation_id":"4c754fc7-8981-4231-aa49-bfa42e2afe9a","resolution":{"observed_at":"2026-08-06T23:35:23.466690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T23:35:23.553945Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.553945Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:aecbc7583de16d1c861bb04a18c39bb333858ce4e1aad20d0bd4f3c1c49df72d","observation_id":"75df10c3-956d-4229-9976-9a275710b2cc","resolution":{"observed_at":"2026-08-06T23:35:23.553945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T23:35:23.814130Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.814130Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:a4aa57ccfbeeed0c27d6de4a655bb63f0d162174c1f54449253fbb5707e5278c","observation_id":"b1b215df-0ed7-4d1c-aaa1-5094f7cc55bc","resolution":{"observed_at":"2026-08-06T23:35:23.814130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-06T23:35:23.944097Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.944097Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:183d734bd7ef35cac9c1ab98db1082ae1537839702eae7832fdd2cdabbf28b40","observation_id":"a980ae08-ece3-4ac1-b7a1-efbb67bcd784","resolution":{"observed_at":"2026-08-06T23:35:23.944097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08311","last_updated":"2025-05-25T07:57:14Z","snapshot_observed_at":"2026-08-07T02:57:31.179488Z","submitted_at":"2025-05-13T07:41:15Z","title":"AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08311","snapshot_observed_at":"2026-08-06T23:35:24.061468Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.061468Z"},"links":{"cited_paper":"/paper/2505.08311","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:0ca003130d5215bee9c63948564dccf6850623f1b1e27df5d5654e8608ec044f","observation_id":"27c4927d-50d6-4850-b166-6cbde3e4869d","resolution":{"observed_at":"2026-08-06T23:35:24.061468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:28.072761Z","title":null,"venue":null,"work_id":"9ec31ed9-87d0-4434-88e4-78a2f5204969","year":2001},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.177911Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:5ad12b8476ea3c7744de4c85b5e7e11463269b97d0942336ca121702503b09ee","observation_id":"05893edd-2dce-4562-9d29-ab19d8dc1d05","resolution":{"observed_at":"2026-08-06T23:35:28.171569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-07T10:14:35.703733Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-06T23:35:24.315457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.315457Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:11d3e13c1a5f1042e1b3226e6738131c914bf35286e9ec704086b7b25193cb5a","observation_id":"a7b0ad1c-dfe7-4e4a-adae-ca65f8b91856","resolution":{"observed_at":"2026-08-06T23:35:24.315457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:27.932088Z","title":"Lightman, V","venue":null,"work_id":"d9b0a3b9-8120-40f4-862c-e1d3c03ea4d4","year":2023},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.459372Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:49b9e9163d4eb3bc872a5f26c816f84e0c21cef18f8753f37d50432a15d8f1cc","observation_id":"0ca78c30-ebc9-4430-9860-f99091beae3d","resolution":{"observed_at":"2026-08-06T23:35:28.006007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T23:35:24.573513Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.573513Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:57d4a20e08ee100903c82c6032464f695c10fe5caf84aaa8acc96f6ebb364f99","observation_id":"ed05b42c-bfbc-49c5-bc6e-4eebdd2cc916","resolution":{"observed_at":"2026-08-06T23:35:24.573513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10400","last_updated":"2025-02-16T09:33:15Z","snapshot_observed_at":"2026-08-07T04:49:07.615320Z","submitted_at":"2024-06-14T20:07:11Z","title":"Self-Reflection Makes Large Language Models Safer, Less Biased, and Ideologically Neutral","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10400","snapshot_observed_at":"2026-08-06T23:35:24.724746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.724746Z"},"links":{"cited_paper":"/paper/2406.10400","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:1ccc0967a60c0ae6bbb3765cebb40656c7bf8bdd08af7ae08837120d195727ce","observation_id":"c94fc518-c1c3-4364-abb8-6dc70395d769","resolution":{"observed_at":"2026-08-06T23:35:24.724746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:24.857491Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.857491Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:0546a6a800ff1cde05db360707ae090fd9529e6c5332b24048c0d83fe09eb304","observation_id":"f0253faf-9e29-44f2-85d1-a91013852723","resolution":{"observed_at":"2026-08-06T23:35:24.857491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:27.814898Z","title":"Learning to reason with llms","venue":null,"work_id":"d9117d2f-e739-4758-9c11-5774cded388a","year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.977274Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:4792d19d977504c674b27dfd85c92440e92df079f133cf1554fafce678171a7d","observation_id":"30db9513-16ac-4cdd-8966-76cd4157e181","resolution":{"observed_at":"2026-08-06T23:35:27.863858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21934","last_updated":"2025-09-04T19:36:32Z","snapshot_observed_at":"2026-08-04T06:24:12.017370Z","submitted_at":"2025-03-27T19:21:05Z","title":"Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21934","snapshot_observed_at":"2026-08-06T23:35:25.107443Z","title":"Petrov, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.107443Z"},"links":{"cited_paper":"/paper/2503.21934","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:1b4f586d684eb8938ccc5ef930323d59bae7cedd286fa1459f3b534096c4e320","observation_id":"4447a8c4-0263-42a2-a4c4-cadde5a67f21","resolution":{"observed_at":"2026-08-06T23:35:25.107443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:35:25.223026Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.223026Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:29e18495c2c67cbef310f9ee261482334e60e27a9c438c2c13e784ba91048a82","observation_id":"19899ab7-647d-4c13-a644-a14f963266dd","resolution":{"observed_at":"2026-08-06T23:35:25.223026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:35:25.347321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.347321Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:e9d5158a45073999333b16537d371fd4b13abf45afcae8f0569c1f1814cf7339","observation_id":"f267deac-333a-4d76-ab52-c96df614623d","resolution":{"observed_at":"2026-08-06T23:35:25.347321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T23:35:25.422154Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.422154Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:219f7d3d65be85fb97671ac8af3ea187d2e4557ba8932485be5b5203e6533d6e","observation_id":"60b13ce0-a760-45f6-8f41-30fb582936b4","resolution":{"observed_at":"2026-08-06T23:35:25.422154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06941","last_updated":"2025-11-20T00:19:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-07T22:42:29Z","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06941","snapshot_observed_at":"2026-08-06T23:35:25.513100Z","title":"Shojaee, I","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.513100Z"},"links":{"cited_paper":"/paper/2506.06941","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:813a9e25ec5c86ef5ed81f519900842c8ae69e5ddb1535cf48b86e6949f0b405","observation_id":"a7a3c7f6-e97c-4c6d-9cbd-0016472e1504","resolution":{"observed_at":"2026-08-06T23:35:25.513100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04524","last_updated":"2025-06-18T08:39:46Z","snapshot_observed_at":"2026-08-06T10:38:46.719692Z","submitted_at":"2025-04-06T15:48:26Z","title":"Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04524","snapshot_observed_at":"2026-08-06T23:35:25.577573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.577573Z"},"links":{"cited_paper":"/paper/2504.04524","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:abebf8aa596237850d23d4e9c1ddee756e50020c27954816156e4fb5185ecc83","observation_id":"1598053d-27c7-4ab3-96c9-bca81f96e6fc","resolution":{"observed_at":"2026-08-06T23:35:25.577573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T23:35:25.657955Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.657955Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:e0da2a7507ed2cdac1008da221d8b667018121bb0cffada0379625cfaa7811ac","observation_id":"2b968bd5-19e6-4957-b0c1-aa930627ec87","resolution":{"observed_at":"2026-08-06T23:35:25.657955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:25.760986Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.760986Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:457edaf346a866047d4e42ffe151abad75a2e596e9121fdb631dc73d0d175644","observation_id":"5b8000a2-3eef-4215-8443-6c85f6547315","resolution":{"observed_at":"2026-08-06T23:35:25.760986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:35:25.844463Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.844463Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:aaabddfa3f3d327cb9efba5efdb6b819c0b4321ea53561ed704f4b6a523dc255","observation_id":"b6312f44-007a-44c5-b259-63c11071d68b","resolution":{"observed_at":"2026-08-06T23:35:25.844463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-06T23:35:25.905691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.905691Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:4cbc81e768cdb44108c24ed457b2da6c9ae47d1203ec31da900addf0de24e8b1","observation_id":"6aab5aa5-f816-4f7f-a513-c48bca8135aa","resolution":{"observed_at":"2026-08-06T23:35:25.905691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:25.968025Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:25.968025Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:f4150bd5529fa1d1620f1f7a769596bb31b75f2a231654fb3a4421661dc24b4e","observation_id":"139c3792-1314-42b8-8e2e-79b50d00ab57","resolution":{"observed_at":"2026-08-06T23:35:25.968025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-06T23:35:26.060516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.060516Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:9e9b2ba42835c8d0f7fb7f8931e147c30056b4d3ab19bb3c15976740daa1098c","observation_id":"9ff0c164-70cc-429d-9d13-dd5503f55605","resolution":{"observed_at":"2026-08-06T23:35:26.060516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:35:26.126199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.126199Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:88fadf0136372a3a11f70253c75b409271abb75bccdb52082d95678c145ecf96","observation_id":"b65b78f8-554e-445d-926c-e8492dce2f6b","resolution":{"observed_at":"2026-08-06T23:35:26.126199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T23:35:26.199324Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.199324Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:01644431410f7c93171468c7204c2c6ad0f852219c10eb04edd3c75cb0cd1e50","observation_id":"cb89ba1d-4170-464e-bf8f-329194e24067","resolution":{"observed_at":"2026-08-06T23:35:26.199324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-06T23:35:26.261491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.261491Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:534561d2df9de677835356c5674e32a1ed2cf059cc9b257a0a4b6495bb8807e2","observation_id":"757d5ee4-ed98-4d43-938c-8a2dcd9f9f35","resolution":{"observed_at":"2026-08-06T23:35:26.261491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T23:35:26.340667Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.340667Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:20d1ca22839410db9cc80bb2b07e1a7be1aa98c006c37a98b01b3f7ca989d605","observation_id":"bbef77fb-62a0-4faf-b2c8-2b08f1c9c8dd","resolution":{"observed_at":"2026-08-06T23:35:26.340667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T23:35:26.431585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.431585Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:eee30574b4dea2cbe7e81023bdc8ed3465fc4409365283405e7b32b7d5a573dc","observation_id":"8f154043-c19f-4642-9927-04ee83a6481d","resolution":{"observed_at":"2026-08-06T23:35:26.431585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T23:35:26.517415Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.517415Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:a7eb9e5488840cfc9d415ed4ec96f1e66d049dcaff01b7b77bc93ffee479326a","observation_id":"97bae04e-4157-4166-85dd-bbe2f8c258f4","resolution":{"observed_at":"2026-08-06T23:35:26.517415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-07-06T21:05:59.227458Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-06T23:35:26.644332Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.644332Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:7f3e59da186c92dc9256c4ebd1706e443b5aad29a31eaf7b54c543e97230eaad","observation_id":"3270981c-bc09-460b-9d43-a36dafd58e5a","resolution":{"observed_at":"2026-08-06T23:35:26.644332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-06T23:35:26.771185Z","title":"Zhao , Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.771185Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:962a48372fafd3eda34714b6200b84d1108af6a5813d189b84a966e780baaa32","observation_id":"58aa6f31-1d74-4a44-a9a7-cbe5f14acbcc","resolution":{"observed_at":"2026-08-06T23:35:26.771185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-06T23:35:26.859900Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.859900Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:00e61745f0dd75e6b2e086e6210d5bbec6007b3523be6351a44cf621c36e8ac6","observation_id":"c8243797-5ce4-49e5-bb40-31d0b449f2e0","resolution":{"observed_at":"2026-08-06T23:35:26.859900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-06T23:35:26.924597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.924597Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:101a57f359638c1a4c0f613f4656c9492b8afc09f59e1968e90b8bdb1186c50b","observation_id":"f5b7a70d-2c48-4245-b798-8a6f865638f8","resolution":{"observed_at":"2026-08-06T23:35:26.924597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:27.002363Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:27.002363Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:a1d18975423f915d65322d24bced5a346fa647a86e9ea21e93fc30bab0e25f76","observation_id":"f1244017-d90e-4068-a597-e1f1b03ddb7c","resolution":{"observed_at":"2026-08-06T23:35:27.002363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:27.044242Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:27.044242Z"},"links":{"citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:ce04bf2665a09eca97200ec90dbc13ea6ce06ece5afa86d8b450e60e2443dc12","observation_id":"e31cead1-e0c6-4f75-97de-6f1cd5759809","resolution":{"observed_at":"2026-08-06T23:35:27.044242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:35:27.149715Z","title":"Learning to Reason without External Rewards","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:27.149715Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:1930b448bdc16e5542bc3f4b97c2eb9b9a7f24e6846e98ec3b2f1200b6ff0965","observation_id":"cf265a47-e7a5-4bfc-b8ac-f31d8d4ded7d","resolution":{"observed_at":"2026-08-06T23:35:27.149715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 14 inbound Pith citation observations for arXiv:2506.17219."}