{"as_of":"2026-08-09T13:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:634e78ff6dd10b5ee3eed918b6c1185409f5f1abd07c090a67342eace652b5cc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:22:13.915142Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:04.779597Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2504.20571"},"observation_digest":"sha256:4f19eb7073b0569448eedcb30c88660c33f46ff1400521933822cca03a75f890","observation_id":"f872eae1-12ef-47fa-8932-3b10e4dffb34","resolution":{"observed_at":"2026-05-15T19:51:05.021005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:4f5fd718c945fb0a08c63c3251b86f26b52e9d5a8d8128de918e27770c554f38","observation_id":"ccb8f4d4-1967-4723-8ba4-f22c4e2ddf11","resolution":{"observed_at":"2026-05-18T15:58:33.591541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-07T12:22:13.915142Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-09T05:12:16.591061Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:13.915142Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:a7533f46f05f444cfcfe87e12fa08197b3f00b70d841dc81646278065e1ebb21","observation_id":"faa37307-72ef-439b-9160-a7171164c542","resolution":{"observed_at":"2026-08-07T12:22:13.915142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-07T05:09:45.969598Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-08T00:32:04.126170Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.969598Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:8d92c7f3a7592656e90af719bcbc9f264087eaa007c2225d6aea888a6ca6cfdf","observation_id":"d96c8c71-2b16-4466-af1d-22da45d8d444","resolution":{"observed_at":"2026-08-07T05:09:45.969598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-06T23:35:26.644332Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.644332Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:a8b939ba46ff18180ce01dbc6650d950fd3403d23a6c9ef514c8bb55b3f260c2","observation_id":"3270981c-bc09-460b-9d43-a36dafd58e5a","resolution":{"observed_at":"2026-08-06T23:35:26.644332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-06T14:43:53.296475Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18122","last_updated":"2025-07-24T06:17:39Z","snapshot_observed_at":"2026-08-06T14:36:16.245142Z","submitted_at":"2025-07-24T06:17:39Z","title":"Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:53.296475Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2507.18122"},"observation_digest":"sha256:cbc720b5085737b6b9413ff30035eba692279af163a9e914f6e5a90e76f14886","observation_id":"f4ab2f1a-28d1-45fc-9b71-6c201380e3f5","resolution":{"observed_at":"2026-08-06T14:43:53.296475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T14:23:53.805378Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.805378Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:830cc3ed65e9107629d80e752a0738ac17179fa6f2f2ce225e10c7f8f7589f00","observation_id":"747bd84f-aaff-4c49-8042-15dc9311dd0b","resolution":{"observed_at":"2026-08-05T14:23:53.805378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-04T19:29:00.555925Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-08T10:27:53.369430Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.555925Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:15ad4a26a4d99891d087bcebb68010d9aa195a9bb5439a754238421d7b982a70","observation_id":"697a7a5f-2530-4662-8311-315ed08504e2","resolution":{"observed_at":"2026-08-04T19:29:00.555925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-04T13:42:31.659664Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25787","last_updated":"2026-06-11T06:39:23Z","snapshot_observed_at":"2026-08-08T11:43:46.547375Z","submitted_at":"2025-09-30T04:57:26Z","title":"Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:42:31.659664Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2509.25787"},"observation_digest":"sha256:67e057b173ed22670d5c479c8ada096027f40c9764606bc23100a329ba4f4a11","observation_id":"798cff28-f776-4c9a-a670-6146378a044d","resolution":{"observed_at":"2026-08-04T13:42:31.659664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-04T12:52:28.369096Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01833","last_updated":"2026-05-25T18:23:42Z","snapshot_observed_at":"2026-08-04T12:52:24.589866Z","submitted_at":"2025-10-02T09:28:13Z","title":"Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T12:52:28.369096Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2510.01833"},"observation_digest":"sha256:d48eb9f025576d5e4308ef7fbb40d25b19b648015bb091786e02e7d9f6d60d71","observation_id":"f5aab0f4-904b-48b3-b249-9fee88d46222","resolution":{"observed_at":"2026-08-04T12:52:28.369096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-04T10:44:32.187306Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-06T09:42:32.578654Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:32.187306Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:63bbd9445baccef6eb41f0202f90f2daaaea0590b21ea82a9c01f10183c5aa05","observation_id":"5b5ae84b-f730-47fb-b671-73d40ce6f37d","resolution":{"observed_at":"2026-08-04T10:44:32.187306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-03T05:14:22.069080Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-08T03:39:37.418634Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.069080Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:d0537458559c02f2873c01c9fb93793fca555e907726462fbdb7f2534e968f8c","observation_id":"c101a8eb-45cf-44a7-a4e0-633897d475cb","resolution":{"observed_at":"2026-08-03T05:14:22.069080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:ea2562929cfdd7aa9b6ea4be422eea90a0a7d311a1ace3845a5a9c70f860c0fd","observation_id":"e49f4d05-92ec-42b3-b369-bebae749d2dc","resolution":{"observed_at":"2026-05-25T07:26:41.736695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2603.27977","last_updated":"2026-05-10T14:55:46Z","snapshot_observed_at":"2026-07-31T06:59:54.210184Z","submitted_at":"2026-03-30T02:54:48Z","title":"SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T22:20:42.183878Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2603.27977"},"observation_digest":"sha256:f614563c029150ddde7bde336676b45aba56d7784f9dea1a29ec264b3b768e9c","observation_id":"e7444054-0638-4bca-97b1-15dfa8bd05c1","resolution":{"observed_at":"2026-05-14T22:23:03.577833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2604.03993","last_updated":"2026-04-05T06:30:50Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:30:50Z","title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T16:58:42.129870Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2604.03993"},"observation_digest":"sha256:5ebcd9a7e9853e9aacd2124541cfbdfac313a323727118574a8fca6f12acd5ba","observation_id":"1620394a-5db7-476b-878b-594992143284","resolution":{"observed_at":"2026-05-13T17:08:01.267693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2604.07864","last_updated":"2026-06-28T14:24:43Z","snapshot_observed_at":"2026-07-13T00:12:30.852396Z","submitted_at":"2026-04-09T06:24:54Z","title":"ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:23.127141Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2604.07864"},"observation_digest":"sha256:469e038b2d5e90aaa06bc46c6eb6e408dc579e45fc4a74590553d414d6c95f04","observation_id":"ace6045b-4a2b-45b5-83d6-fa07d474bbb3","resolution":{"observed_at":"2026-05-11T00:20:51.797944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2604.11547","last_updated":"2026-04-13T14:37:38Z","snapshot_observed_at":"2026-08-06T13:24:15.388909Z","submitted_at":"2026-04-13T14:37:38Z","title":"Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:32.294359Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2604.11547"},"observation_digest":"sha256:8899594413189233c78a268b4091f2cb143b3cb5e62fa9bc60dca24fe6e66b30","observation_id":"fdaba3ed-b7b3-49d7-aaf4-79dd35dc93b1","resolution":{"observed_at":"2026-05-11T10:56:02.613184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-07T12:08:03.856446Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:6d85ff3cf251827a33aac203f3341c63f8e513b6dc8996a26107dfdf733023a4","observation_id":"b03f0231-88d5-41b8-972d-ca08f6ba4319","resolution":{"observed_at":"2026-05-10T05:36:02.057418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:092f0f9df0b23ff03e11a3a5e1a6eb6981215b9d24208db0a347db8c209bc5d7","observation_id":"bf6d7a23-a01b-4f6a-8ca1-5d8763337f9c","resolution":{"observed_at":"2026-05-11T20:11:12.234550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.08516","last_updated":"2026-05-08T21:55:41Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:55:41Z","title":"OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T00:52:42.845447Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.08516"},"observation_digest":"sha256:2882ce365fb734bc898383024f1d51d7f0307d9853d69d82a2416f54093331da","observation_id":"de5143a8-d07a-4421-9ad5-12e4fd889d43","resolution":{"observed_at":"2026-05-12T08:36:26.934986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:57:30.877915Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:75eff05ba578b4efdca88f06d9212bb004d8baea0659a0d548dce0da230b1ae8","observation_id":"012ab47c-5b0a-4a1f-82c7-1240e448662f","resolution":{"observed_at":"2026-05-13T02:07:09.050141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:38bd4ea3688258bd771ee2b14ad7a710cdcb4bbfa75dee55015bb8dce8bce74a","observation_id":"bcb43b4b-7ee9-4305-bc98-03103ae8f655","resolution":{"observed_at":"2026-05-20T22:49:10.570853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.17187","last_updated":"2026-05-16T22:52:11Z","snapshot_observed_at":"2026-07-06T23:28:12.114488Z","submitted_at":"2026-05-16T22:52:11Z","title":"PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-20T14:05:14.737146Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.17187"},"observation_digest":"sha256:28ef8a3a211fdc9d85863d5537234d64148c794c4c28005f4fe7073a168b1ac8","observation_id":"aa455587-5ff9-4913-819e-cf313bf74a6f","resolution":{"observed_at":"2026-05-20T14:08:20.454430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.21801","last_updated":"2026-05-20T22:59:02Z","snapshot_observed_at":"2026-07-31T22:43:35.705855Z","submitted_at":"2026-05-20T22:59:02Z","title":"Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T08:53:02.051453Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.21801"},"observation_digest":"sha256:8dadc59d5029bcb88ac1890c499199ad35c7d656e7cf15d04dc94fbfe96f0bd7","observation_id":"8e5a1d7e-9f9f-4e73-951d-06be1ae44ca3","resolution":{"observed_at":"2026-05-22T08:54:45.763620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.25864","last_updated":"2026-05-25T13:55:12Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T13:55:12Z","title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:46.313028Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.25864"},"observation_digest":"sha256:ced7f9422f6bde0f74f778a11af05f20339ebbe39e170096b06684a142428ff5","observation_id":"76cf23bc-fa70-4e46-ba30-31baa4c5f92e","resolution":{"observed_at":"2026-06-29T23:04:01.329523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:b094a4b69128aaba22f53c99d609ef4ace2a5b4b6a8d69df9f66402f6fe12f79","observation_id":"24bdac98-83ff-46a8-911f-ab6accbe959b","resolution":{"observed_at":"2026-06-28T17:22:24.919029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:51a57b136be495e49a3f582795382c5fa5f49632b1714bee264c9f7f92f14184","observation_id":"9bf97f62-f105-4923-a36e-4f2194fd0b89","resolution":{"observed_at":"2026-07-01T20:46:14.339011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2606.08501","last_updated":"2026-06-07T07:59:55Z","snapshot_observed_at":"2026-07-06T23:47:57.376596Z","submitted_at":"2026-06-07T07:59:55Z","title":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:21.493677Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2606.08501"},"observation_digest":"sha256:13c4fe2c9875aa82e27c26acd1b4d4e94689553d353a2c86af92600a39837820","observation_id":"e7df529a-4b27-42d3-acfc-bf84f707eb8d","resolution":{"observed_at":"2026-07-02T22:57:26.574378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2607.08164","last_updated":"2026-07-12T22:43:21Z","snapshot_observed_at":"2026-08-02T18:28:02.788020Z","submitted_at":"2026-07-09T07:02:56Z","title":"Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T12:03:31.513760Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2607.08164"},"observation_digest":"sha256:fc9eb478b18497059a58f7b05c81b4bda0159c45d3e3d3d3d3269c6c6a07da3b","observation_id":"e65cf1e1-7936-4b03-9069-6500ea32705a","resolution":{"observed_at":"2026-07-10T12:07:03.466523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-07-14T15:38:28.159585Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025a","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2607.08164","last_updated":"2026-07-12T22:43:21Z","snapshot_observed_at":"2026-08-02T18:28:02.788020Z","submitted_at":"2026-07-09T07:02:56Z","title":"Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T15:38:28.159585Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2607.08164"},"observation_digest":"sha256:a66c91cb8caeb700146fdef65132a7b81defebd23b6256686766aab22f2b9008","observation_id":"fa1b5eb4-f59a-4f18-8e82-07f57f55f4f6","resolution":{"observed_at":"2026-07-14T15:38:28.159585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-07T10:19:43.621441Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-06T17:18:23Z","snapshot_observed_at":"2026-08-09T13:12:22.729865Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:43.621441Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:ff4b9e59ef3fe96bc5a794f43147e872677017ab7dabc63fa2b6a18379dbe6ed","observation_id":"9cfbb828-d21e-44c6-8a5b-d32ece739d6f","resolution":{"observed_at":"2026-08-07T10:19:43.621441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.05812/citation-record","integrity":"/paper/2504.05812/integrity","json":"/paper/2504.05812/citation-record.json","paper":"/paper/2504.05812"},"outbound":[],"paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2504.05812."}