{"as_of":"2026-08-07T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:231dcfb68bb3a68b391bafd2c36b0286e1337d94c66d1347cd11125753d51109","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:35.267794Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:47:19.009023Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:29:15.119817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:e6425e91970ff9a0402283646706e216acda5debbed2654373b4b71361d89758","observation_id":"ef08bf37-6769-454f-b0b7-bcb326090e57","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-06T13:47:19.009023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20278","last_updated":"2025-07-27T13:52:15Z","snapshot_observed_at":"2026-08-06T17:26:07.000383Z","submitted_at":"2025-07-27T13:52:15Z","title":"MoL-RL: Distilling Multi-Step Environmental Feedback into LLMs for Feedback-Independent Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T13:47:19.009023Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2507.20278"},"observation_digest":"sha256:6515809d72d615e599d6603685e985d1398baf030ee1383e83fdeea65c58a595","observation_id":"890f6533-5d3c-4937-8e75-fd63a407581d","resolution":{"observed_at":"2026-08-06T13:47:19.009023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T13:53:36.062617Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback.arXiv preprint arXiv:2506.03106,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25004","last_updated":"2026-06-08T14:01:20Z","snapshot_observed_at":"2026-08-04T13:53:31.767096Z","submitted_at":"2025-09-29T16:29:04Z","title":"CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T13:53:36.062617Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2509.25004"},"observation_digest":"sha256:e780edc3c92e19ad59fece83ed9cd75fad5539db827788a20b03f006a2a12837","observation_id":"d5df3f36-6a6e-4d02-a269-d7f95777e969","resolution":{"observed_at":"2026-08-04T13:53:36.062617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T11:11:12.915233Z","title":"1\"> <problem>[Example problem 1]</problem> <solution>[Correct solution 1]</solution> </example> <example id=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-08-04T11:11:09.166918Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:11:12.915233Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2510.06672"},"observation_digest":"sha256:5ddad9819823d4afd3c4336263eff1e137b3ec6f11cefd8d6732ef8f913b6712","observation_id":"a04af6ba-5ecc-4578-9d72-008d996753aa","resolution":{"observed_at":"2026-08-04T11:11:12.915233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T10:53:10.877236Z","title":"cashmere clothing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.877236Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f083c7363299a46e40d7e353dce2eab82f883a8524950327a11182eaca43c90f","observation_id":"27f1b512-88a9-4cbb-929a-98e9068fa0ce","resolution":{"observed_at":"2026-08-04T10:53:10.877236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:403e2ffca26ade456cde195861986b4fdf51e2652984554d00f8225bb277f845","observation_id":"83044b5c-6cf1-4702-a64e-c12687fbd697","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:3d5c7d477f0eefe13b605fd5bdd0b5700dd0d7c8ff2b2daeabe4e5f47d82296f","observation_id":"9af02442-d983-4e7b-b991-45aa307c7da0","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T15:21:55.984824Z","title":"A , C , D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17375","last_updated":"2026-05-26T19:11:48Z","snapshot_observed_at":"2026-08-03T15:21:53.597232Z","submitted_at":"2025-12-19T09:22:11Z","title":"AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T15:21:55.984824Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2512.17375"},"observation_digest":"sha256:c9b19b857e5e1b18c9de4f196d43cc800ab753bd6354d93a5d074a181feff7cd","observation_id":"3baccb9b-70e2-4b70-be63-a0c3d0af0ffd","resolution":{"observed_at":"2026-08-03T15:21:55.984824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T05:14:22.180784Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.180784Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:08899d2a3bed83ca1472a3b3dfa39787bc88894dffbaf0031031435e716d603f","observation_id":"9fcaacfb-fa23-4a17-aee4-351c5a09750b","resolution":{"observed_at":"2026-08-03T05:14:22.180784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:e64bc726f9131db3d84d1618de64bb63c07e0887cd4caa588503e553da7b56da","observation_id":"00596522-fd42-4123-951a-941771bc4d7c","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:69009ccb25ea77ac7d160a6b5ca630253e1adadba99ff5766c8a330a0db96b63","observation_id":"61bce089-f9ff-404c-b03d-b31eef3ffdeb","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2604.07941","last_updated":"2026-04-16T04:43:04Z","snapshot_observed_at":"2026-08-02T07:24:04.075021Z","submitted_at":"2026-04-09T08:00:37Z","title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:58.515666Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2604.07941"},"observation_digest":"sha256:389052f4f4dcb48bb8d241489f0cf9a7c365d7de5368ed6cd615c57d62b74ad7","observation_id":"266e7451-b303-4c0b-a695-4a57d85bcf95","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2604.23318","last_updated":"2026-04-25T14:11:23Z","snapshot_observed_at":"2026-07-31T10:26:51.719683Z","submitted_at":"2026-04-25T14:11:23Z","title":"Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T08:05:36.206946Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2604.23318"},"observation_digest":"sha256:af9f5dc7e57b36a99ee22f1912318d1e8bcb4f476e92f1e8e32674808c2d0f5f","observation_id":"11c880c2-cb3d-4c40-8b8a-947b0597696c","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:fd118eda2a08c707139139827277c1fc7bfe3ebd5a0f59315b803518b2f6975d","observation_id":"0be93c8b-7545-4a9b-938e-05314ec92922","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:5d4d0e1e9868c503bfba349c8af4287f80481563201f8993d0516cf186f00308","observation_id":"48110f5b-b2ff-4350-abed-0302f3f83bdf","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:5cbdff471850f7af4149c7208c09eb531c6cbcba809fc4f2572733ad36b9e8e5","observation_id":"49fb552d-fa19-4b23-9a97-b8ac7eeb583e","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.08666","last_updated":"2026-05-09T04:07:20Z","snapshot_observed_at":"2026-08-02T05:46:41.345933Z","submitted_at":"2026-05-09T04:07:20Z","title":"The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:24:03.186413Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.08666"},"observation_digest":"sha256:5910ba70dd380200a15f27b05db568e41e18bdeb2fc11624c682360d8fcde92b","observation_id":"c92ccc7a-cd02-4fe1-bf07-cb4b694efa8a","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-04T16:10:21.909941Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-14T21:29:36.803832Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:97d7e1c446ba37c0196a9c10e0fd0adee79cd9d4fed12f8c4245fe29b42b7472","observation_id":"88a1d0f1-93d7-4601-875a-9bc7a2fa9e35","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-02T16:16:00.555280Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:9e983950fa4b20a514244408cc2133f3492834490594bc1d4125dc6c87fb34d1","observation_id":"1079fdf3-9892-4d3b-833e-04649fba1d4d","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-05T23:10:42.483401Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T10:41:25.205368Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:85045e6018344b2e60c8742067742ddeca1adfcde1d38d2bc7d926ae0d6c4117","observation_id":"655f3118-46d8-4a0a-bbeb-1c7b7de284f2","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T02:23:32.244687Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-05T23:10:42.483401Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:23:32.244687Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:fcc45f974e21124ed2ecfb100bf30dfd529dde03815acf131d74c9998c6a5d47","observation_id":"257ced7d-efc5-48ce-92a7-13ba8301d3d2","resolution":{"observed_at":"2026-08-03T02:23:32.244687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.18799","last_updated":"2026-05-11T09:22:39Z","snapshot_observed_at":"2026-08-03T03:54:24.879979Z","submitted_at":"2026-05-11T09:22:39Z","title":"ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T22:51:56.666980Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.18799"},"observation_digest":"sha256:a090996b19da6ba1977372e3d495d2293ac47d1fadf70aafab955d4007c5b78b","observation_id":"903fc1e0-9e56-49c6-8d49-e5453ff4554e","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.18851","last_updated":"2026-05-13T11:04:31Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T11:04:31Z","title":"STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T20:47:16.236629Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.18851"},"observation_digest":"sha256:79bed78f25492934c0e1e2d69c3c77288a9498a43f23b9f3831633f989b6b996","observation_id":"0b8c0dfe-6fa1-4a06-81dd-689eda059d4e","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.20506","last_updated":"2026-05-19T21:23:24Z","snapshot_observed_at":"2026-08-03T04:27:59.284440Z","submitted_at":"2026-05-19T21:23:24Z","title":"Reinforcing Human Behavior Simulation via Verbal Feedback","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-21T07:21:48.649289Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.20506"},"observation_digest":"sha256:19d8b8242805289f004516479b730c883b7daf1a0d29215a84e8853d5d2230ae","observation_id":"83749c53-f9af-400e-8a4e-5f7b7a0b53fd","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.24547","last_updated":"2026-05-23T12:28:14Z","snapshot_observed_at":"2026-08-06T04:46:08.469451Z","submitted_at":"2026-05-23T12:28:14Z","title":"RL with Learnable Textual Feedback: A Bilevel Approach","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T14:36:31.047856Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.24547"},"observation_digest":"sha256:2e0943ae26e1f5db6e8ae8012c538bef769884e7b5f21f92104ba026343a02db","observation_id":"2c37c286-2716-4642-a16e-14e9f9a86d98","resolution":{"observed_at":"2026-06-30T14:44:45.361285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.25507","last_updated":"2026-05-26T17:23:26Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T07:11:50Z","title":"Credit Assignment with Resets in Language Model Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:18.827822Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.25507"},"observation_digest":"sha256:b15d79bfd158008cf062d41e522bf1c40a6790a966499196c4bb4af358b59195","observation_id":"48d2b711-066b-41b2-9cc9-1acf83b95f91","resolution":{"observed_at":"2026-06-29T21:53:59.255224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":189,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:0dc57877c8992c64fd0a4583488f67a61bdc2d16dc952d2b4f01a9703b691524","observation_id":"660eefdb-b031-4778-b04d-c84b18bac9e8","resolution":{"observed_at":"2026-07-01T20:56:13.705760Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:660682e9c957a76ab0b4ebd74f98fd6beb4970f3ee1856496f76a73dad88681f","observation_id":"5fe53e6d-5bfa-441c-8a6d-0c93514215e6","resolution":{"observed_at":"2026-07-04T00:29:15.122126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, and Helen Meng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:09a2dbad27e8b0bbafc1acff7f3e4791d9707299aff534a991aa75cdf3eacd11","observation_id":"c34e7e5f-a8a7-40f4-b444-3fab060e95ae","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-01T16:07:59.623378Z","title":"arXiv preprint arXiv:2506.03106 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18110","last_updated":"2026-07-20T16:08:49Z","snapshot_observed_at":"2026-08-05T10:41:27.894489Z","submitted_at":"2026-07-20T16:08:49Z","title":"LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:59.623378Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2607.18110"},"observation_digest":"sha256:fdd57399cf07474b76a842d1b730831778272f97550d319ddd8eb8a6122313d7","observation_id":"483e6977-b08e-4d13-b184-6573aeae10e3","resolution":{"observed_at":"2026-08-01T16:07:59.623378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03106/citation-record","integrity":"/paper/2506.03106/integrity","json":"/paper/2506.03106/citation-record.json","paper":"/paper/2506.03106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.775839Z","title":"needle in a haystack","venue":null,"work_id":"2585965a-db91-41a1-9eb7-3f77543fb50d","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.192749Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:53a3551cf685dfa6bcab55d090751bcbb433fe2c905566c73ba144a4548c179e","observation_id":"a579f800-b35c-4935-90c5-4a76dec37ed3","resolution":{"observed_at":"2026-08-07T11:15:35.779353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.766425Z","title":"While the worst-case complexity remains dimT E(H, ℓ, ϵ)≈O(|S|L), the critique acts as a pruning signal","venue":null,"work_id":"b00124a0-f3ce-4c06-bcb7-b83f8aec10f7","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.195999Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:9cbe73a671909328edb0ac76c6fb3df7a23dbcc9e11ede3d7d396fcb35966f63","observation_id":"8f534efd-4ea8-42f6-8d0b-09cda7837070","resolution":{"observed_at":"2026-08-07T11:15:35.769972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.687117Z","title":null,"venue":null,"work_id":"1324f9c8-9a39-4645-8fd8-642ec20a320b","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.222317Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:eadd17b260757691a4d59e61f0b3bb0fc237215048663c140a31a987bc0f9675","observation_id":"b7ad4a6d-2136-4acf-a79a-1b4869b9c1c7","resolution":{"observed_at":"2026-08-07T11:15:35.690194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.170943Z","title":"Wang, Y ., Yue, X., and Chen, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.170943Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:9152103d8a7f620bac1b8edf2bc11659cbc975f9d0f4e4be31979ea4fb25ff08","observation_id":"90b9b898-9e89-4f9c-ac0c-dbff6c9078c9","resolution":{"observed_at":"2026-08-07T11:15:35.170943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.550836Z","title":"The correct maximum value, as derived from a proper analysis, should be 10 3","venue":null,"work_id":"a2e29a58-1c8c-4982-8a31-5a4db33d6660","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.267794Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:8b4bee9956dfa34b8acaf8fd659426f1608fa9e4735ab7cbb469c60a1e944727","observation_id":"ad29d770-e3e6-4bc6-877a-0c21c185e548","resolution":{"observed_at":"2026-08-07T11:15:35.556971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T11:15:35.178558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.178558Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:2f93dbc05feba2524cc7e3e01f08184268d6791513feaf8c4f54a3cfdba1e12a","observation_id":"ef39f899-e63f-45a1-b692-4364d4fae2ea","resolution":{"observed_at":"2026-08-07T11:15:35.178558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.181921Z","title":"Zhang, X., Peng, B., Li, K., Zhou, J., and Meng, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.181921Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:a29fa40c8df3be4a2e85b23fbfe264acf359b99e0798a63823d8e6d1a5812a04","observation_id":"39b23d80-f7f2-4675-ad68-235586a58802","resolution":{"observed_at":"2026-08-07T11:15:35.181921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.185214Z","title":"correct” and “incorrect","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.185214Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:32af0e3e05c35b4bdb62e5c55197deccd63fd280dac772c8a8cb0cd59f858dec","observation_id":"0d54d17d-9fa2-43c1-bf9a-a3de9d99d77a","resolution":{"observed_at":"2026-08-07T11:15:35.185214Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.785778Z","title":"As illustrated in Figure 8, this function is bounded between (0,1) , where x represents the token probability of the policy","venue":null,"work_id":"3c10ddd5-22f0-4527-9542-10f2ad1de3f4","year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.189419Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:5b3e567178844f3fee38c60a14bcdc6f90b87ea5303b9b91ad7a89acd535fa77","observation_id":"5f77a2b8-0532-498f-aa9c-3d95e421f3f1","resolution":{"observed_at":"2026-08-07T11:15:35.789361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.756607Z","title":"In this setting, the feedback function is simply the reward itself, fη(a) =r(a)","venue":null,"work_id":"bef469d0-b071-4386-aaa9-8d74c5a68656","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.199170Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:e6f9702173d795ab401eed014bf589177f7f72ecf94eb109845ced09529b542f","observation_id":"7ffef02b-96c2-48ce-a18e-b35fb89a5553","resolution":{"observed_at":"2026-08-07T11:15:35.760582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.746227Z","title":"The probability of finding the unique optimal solution a∗ is equivalent to sampling the correct element from a set of sizedwithout replacement","venue":null,"work_id":"e1e18130-b3cd-4f6e-ae13-628e71f150d0","year":2024},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.202422Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:9a695d68c5a17e61b6cb1ac6e6e0ae0cee58461c9f737105305b6c9325d76d23","observation_id":"f008ba4f-474c-4083-8873-e2fee8bd2e6d","resolution":{"observed_at":"2026-08-07T11:15:35.750597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.735265Z","title":"Since γ≪1 , the gradient magnitude is significantly dampened","venue":null,"work_id":"c8b8d6a0-4d3c-45c0-accd-9e32aa39f205","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.205872Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:3fea4f13cd44fa4c4413d10d66fb435cd4e5d893d36ed18f750a8d4ca150523a","observation_id":"1b7aa275-33cb-445b-9173-d95966e02ccb","resolution":{"observed_at":"2026-08-07T11:15:35.739780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.724752Z","title":"weaker refinement,","venue":null,"work_id":"9a8ffab6-a46e-46e6-929b-e9f72830e73a","year":2017},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.209183Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:360c1d0a8471a70b16339c09488c5d0b415416fe7a806d1b13b7665b311c74cf","observation_id":"9f3ca082-9d4f-44c2-8694-c307e8481ab4","resolution":{"observed_at":"2026-08-07T11:15:35.729061Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.705661Z","title":null,"venue":null,"work_id":"32744851-d3e9-4567-aeee-244ac017e3e9","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.215979Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:b7e9fd9fa360f520c084bf5ceeb85ade5fc88f41a6bdc71b525030866c27af08","observation_id":"119a2374-8a19-4e5b-94a6-3c2f71405470","resolution":{"observed_at":"2026-08-07T11:15:35.708975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.695863Z","title":null,"venue":null,"work_id":"8ea537b8-4a26-4a70-9196-125b7e143c3f","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.219150Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:406f18ab68b1a81155f82dc9e41b10d0068075e1ef54f6038bc5bdde92509fd8","observation_id":"c9c10e5b-01ee-4e8c-9b10-4407e713a172","resolution":{"observed_at":"2026-08-07T11:15:35.699270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.677628Z","title":"Conclusion:","venue":null,"work_id":"cd587ac7-3be4-4eab-acb6-a412bd5b10c6","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.225726Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:82579427e86f83e5e9b709eccb7a1299db4e6d41f962a0937f16ab96d8e27677","observation_id":"7b28c74e-0063-4c28-baa5-b1582b90f90b","resolution":{"observed_at":"2026-08-07T11:15:35.680966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.667945Z","title":"Calculate the cosine of the angle of the axial section of the cone at the vertex which is also the apex of the cone","venue":null,"work_id":"b0086454-1bc6-4c57-8ac0-0dd0985f1d94","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.229585Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:ba4ead5b32dd80dc12db9d2aa95602df6f749f16e10707bde2cd74a2ca4db589","observation_id":"459c337b-f614-44a2-b336-4b4a4742ad76","resolution":{"observed_at":"2026-08-07T11:15:35.671451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.657941Z","title":"Wait, let me check that again","venue":null,"work_id":"2c1cc4fc-b68c-43d8-9730-91c353faafee","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.233555Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:cd592c1a105f1bf889894a3ba296b4c684186b6909ed21e90bac76077e320c24","observation_id":"b3b5fbd5-10bb-4732-bb84-ca5c18c21d16","resolution":{"observed_at":"2026-08-07T11:15:35.661156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.648676Z","title":null,"venue":null,"work_id":"ff00833f-b2e2-4638-a52f-f153f1148d59","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.237179Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:73e8b2bc7f7507a3cc1b2788a2dd9d5d2e740a6bdd00692929830c953ab149c0","observation_id":"28757a41-8f8a-4084-a7b3-6f5e700fdf57","resolution":{"observed_at":"2026-08-07T11:15:35.651769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.628249Z","title":"Therefore, the exact value is − 9 100, and the approximate decimal is −0.09","venue":null,"work_id":"fce19641-e47c-498c-9a23-bead5599fa21","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.244109Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:85131b8d7e4fc23cac737fd7bd7ba62f7ec4157e7d0d7ae2a34c121a158e1641","observation_id":"13b69af0-af44-488c-b3ad-25abf3a3b693","resolution":{"observed_at":"2026-08-07T11:15:35.632214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.617086Z","title":"Alternatively, if I think about angles: A is arcsin(0.4), which is in the first quadrant, B is arcsin(0.5) which is π/6, also first quadrant","venue":null,"work_id":"1694f268-0342-40e0-ac7a-78d006477585","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.247160Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:4751eb239212422350fbe40a02a3c50b8891bce86953c79fbd740355e9ef0e86","observation_id":"f59290c6-e1c1-4789-ab3b-44eb96d8ac3c","resolution":{"observed_at":"2026-08-07T11:15:35.621418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.607072Z","title":"Alternatively, using complex numbers or other methods? Maybe not necessary","venue":null,"work_id":"e1268f08-ac71-4648-a0f2-907c39532a8d","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.250430Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:660af48f556346c22a6b2011c3f4848f2673851cdaaec838c6ddfc98ae0d720c","observation_id":"93a02610-6565-4c74-b972-b2944de36dba","resolution":{"observed_at":"2026-08-07T11:15:35.610767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.596639Z","title":"The trigonometric substitution should be used more carefully, ensuring that the constraint is satisfied throughout","venue":null,"work_id":"d3fa0996-764c-424f-b3fa-83dd398eacac","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.254352Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:b45e777896ce766903b7ca3f0ed6088fe6a14415b813e3c3a4c89c460e1ef907","observation_id":"f43a9e87-3503-4e60-8d7d-88999f07724e","resolution":{"observed_at":"2026-08-07T11:15:35.600273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.585956Z","title":"The identities used do not lead to a valid simplification of the expression","venue":null,"work_id":"80ec3eea-285c-41b5-bda5-75b949c30e5b","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.257744Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:c281a301a61c3a3f1784a8ec9503e41399ee0aafe77d9fbcd0f643bab508906c","observation_id":"38bb0bc3-ed9d-43a2-a587-2e083088dddc","resolution":{"observed_at":"2026-08-07T11:15:35.589374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.575668Z","title":"The derivative should be taken with respect to the correct variables, and the critical points should be found accurately","venue":null,"work_id":"0aba2c33-aee0-4bb1-b1d3-5fb94fcb5711","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.261000Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:49aa6bbcc09d44f299f613d9f9c232ca30d698d1dd1e0a6dde9e1ed9e6d5cc72","observation_id":"1857b7b4-4f3e-4372-939d-e47bc3240fc5","resolution":{"observed_at":"2026-08-07T11:15:35.579589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.564109Z","title":"The values chosen fora,b, andcdo not satisfy the constraintabc+a+c=b","venue":null,"work_id":"613888e2-4ff4-49a7-8a15-a60290baae70","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.264265Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:e50662760d645795c313d881326723c75fcc28f4416099a31f83d6ca61adb01e","observation_id":"47df313b-3674-4c95-a2a8-6db297b6c724","resolution":{"observed_at":"2026-08-07T11:15:35.568539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.638350Z","title":"Therefore, the value of the original expression is −9 100","venue":null,"work_id":"fde54428-de86-4982-bc97-e99a98e1a9b2","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.240692Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:5f1e1b5cd73fbfe2c96ce0aa9234a9ae24d29af3ee1c42678b9de1e219a9c308","observation_id":"fe9f3e00-79b7-48ae-8afb-028fe77f3064","resolution":{"observed_at":"2026-08-07T11:15:35.641688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.715300Z","title":"Wait,","venue":null,"work_id":"604d2eef-114d-4ad8-8462-e28aca45080d","year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.212533Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:2d4e5891111afbde537a1703b5071bae107a71e92a8230bb1c5fc33758d18146","observation_id":"9a8caf7d-b4f7-4f1e-96d6-2abf3d3b9665","resolution":{"observed_at":"2026-08-07T11:15:35.718737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T11:15:35.163327Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.163327Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:d5027929308f16c98ea59dfa8a7908d8b1f567a31cfd80a3c25db941e47b7321","observation_id":"25931b4a-6bc6-4e11-96a3-e127664f2d9a","resolution":{"observed_at":"2026-08-07T11:15:35.163327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:15:35.167088Z","title":"Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., Zhang, H., Zhang, M., Li, Y ., Wu, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.167088Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:3bd3c895527909f50e65622cfa9c3a31f65b064a5de608b0e9af4841fe5cfd00","observation_id":"8ffcab6a-b67c-4d0d-9558-9ec2d5b83103","resolution":{"observed_at":"2026-08-07T11:15:35.167088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:15:35.158495Z","title":"Lin, T.-Y ., Goyal, P., Girshick, R., He, K., and Doll ´ar, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.158495Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:787e6f0c4aeaa05f48fb3feb0c9323b0d36a4f5aa4e8cd7f515c72d796ff442f","observation_id":"d350a58a-8bf7-4c42-8595-7e3dbfa237f4","resolution":{"observed_at":"2026-08-07T11:15:35.158495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-07T11:15:35.175237Z","title":"Yan, J., Li, Y ., Hu, Z., Wang, Z., Cui, G., Qu, X., Cheng, Y ., and Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.175237Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:f87149351012ff932e7e8ea62c3767d591a0c7f13a52871bd8b9d536ef5235cd","observation_id":"45364875-fb18-435c-8de7-197aa7aacc8a","resolution":{"observed_at":"2026-08-07T11:15:35.175237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","latest_version":7,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:06:10.792802Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 30 inbound Pith citation observations for arXiv:2506.03106."}