{"as_of":"2026-08-08T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:125fbd4271ba0270d2bc42b7dd2166ea302f5826f97b17ba5c4ad0a6ce6f8acd","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:57:30.540771Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03119/citation-record","integrity":"/paper/2608.03119/integrity","json":"/paper/2608.03119/citation-record.json","paper":"/paper/2608.03119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-08T00:57:30.386244Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.386244Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:ba138fc72ed9e6498abae4e5a357c4ee7d2bd5434486bf22f616fb10735549ff","observation_id":"ecba873f-4762-45c8-81f9-16fbd33de8e5","resolution":{"observed_at":"2026-08-08T00:57:30.386244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.390868Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.390868Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:dcdf8a5fd9b316171c581d0ae22df8cf9895b7d5463b87422061acf06124a949","observation_id":"07b09dfb-23e2-4526-b328-55a6c87417bd","resolution":{"observed_at":"2026-08-08T00:57:30.390868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T00:57:30.394592Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.394592Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:5ce590ec2690c8517d78c8a8212b096f384288e0f69eba329e7f64101abc24a2","observation_id":"d87970c5-f31c-4c38-a7f7-36f9bb00f687","resolution":{"observed_at":"2026-08-08T00:57:30.394592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T00:57:30.399182Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.399182Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:220aff7e35cf71eab000bf476b7114d46b22e7cba4410f7f0d4999c9dc70526f","observation_id":"18005705-c99c-4694-8124-143e4fa47855","resolution":{"observed_at":"2026-08-08T00:57:30.399182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T00:57:30.403611Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.403611Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:1a28f829d7c89bba3eb6cc0edb6f52a96e6d001bc1e23e6ed3ac3b53479bb50b","observation_id":"97f01257-2ca2-47b9-901a-e1134505b677","resolution":{"observed_at":"2026-08-08T00:57:30.403611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-08T00:57:30.408060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.408060Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:fa2f31e2053697a09cd20280f90b5cef525cc1409f420b71b34502b2b0524231","observation_id":"e80c2880-744f-4faf-8eb8-199be991df52","resolution":{"observed_at":"2026-08-08T00:57:30.408060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:31.461524Z","title":null,"venue":null,"work_id":"db4861af-b040-4450-8e9a-4a92008be711","year":2021},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.412971Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:97f71cc2ec0f1c9437be876a90897b496754e3fcbc508f591637abd22afa60e5","observation_id":"74b9c92d-b17b-4834-8392-bbf267c0b8a6","resolution":{"observed_at":"2026-08-08T00:57:31.465507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-08T00:57:30.416789Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.416789Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:bd99d98e6236063307edcfe71c9d0cc7cdf9dd2261220027d38f76a8fe1ecfa4","observation_id":"484fb415-0e14-4aac-8b65-118275eaffee","resolution":{"observed_at":"2026-08-08T00:57:30.416789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:31.450303Z","title":null,"venue":null,"work_id":"c353d390-e3b4-4780-bd10-aafbe0aa08fb","year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.421426Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:9419da3dc34ffcdb514cb6d52955f373453e851ff25dd293a5a8162697b16751","observation_id":"31830e38-500f-4397-aac4-55b103e5e2ae","resolution":{"observed_at":"2026-08-08T00:57:31.454145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-08T00:57:30.425198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.425198Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:49573d623db207c90f175f6d1417e8947a77f30e07ab6179b7cb2a9e347b57a2","observation_id":"99c47dc0-d0af-4189-87b4-953c5e17baf9","resolution":{"observed_at":"2026-08-08T00:57:30.425198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-08T00:57:30.429284Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.429284Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:50dfecd60a8fe1b1f48a96eb633e1eaa7f74df79d6d2a943dd4780e65b75b515","observation_id":"4d683406-7572-4bfa-ad39-ffa84c38e2fb","resolution":{"observed_at":"2026-08-08T00:57:30.429284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-08T00:57:30.433618Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.433618Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:53f5906c8498f2d7383cfdc4f37226044ad69cbd159ca0d7a923d3e90ab8c21d","observation_id":"8a4d22af-d5c6-4369-b5b9-1450eff70389","resolution":{"observed_at":"2026-08-08T00:57:30.433618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-08T00:57:30.437630Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.437630Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:c4541e78149c15934395e980471531e56db861cea012403965246f1588287155","observation_id":"856f1773-7b5e-4e2c-af7e-5ab9a838f22f","resolution":{"observed_at":"2026-08-08T00:57:30.437630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-08T00:57:30.441747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.441747Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:908afe27428e41fef4f988ae1697ced57504636bb17eb7e6a0f7a7fef67c64db","observation_id":"acccc0d8-e472-4e29-b736-14e9ece3952e","resolution":{"observed_at":"2026-08-08T00:57:30.441747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T00:57:30.445813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.445813Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:da1fc23118a127d9e1f2d4dc065084cb2ac1f27f20b36391f2bd72911b8cd18b","observation_id":"6a4a8b41-64b2-4fe0-8847-50fbe8d8f044","resolution":{"observed_at":"2026-08-08T00:57:30.445813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:31.439967Z","title":null,"venue":null,"work_id":"a760ba43-7767-4faf-b1ab-d87aaa5ffcc0","year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.450080Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:acf6c485fbfa6d4cab40352eae2ce91964b2366f1615e9754e1beb240bb9361d","observation_id":"639fe561-f601-4de2-9b25-cb60c4cb8fcf","resolution":{"observed_at":"2026-08-08T00:57:31.443605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:31.429171Z","title":null,"venue":null,"work_id":"0c2075b2-0db1-4b1d-b138-387f58d0d781","year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.454210Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:6a800909caa6613e685dc144649fe6e3f3d42c0fbb16781f700e7fd07d97d22e","observation_id":"d9b300f8-7a82-4088-a60b-468e9679e659","resolution":{"observed_at":"2026-08-08T00:57:31.432998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-08T00:57:30.458018Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.458018Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:1676e0c15be9ecc8818bb84b96ae3ba0beafeaa19886ba9472911c0e8ad1b6d1","observation_id":"031d6294-c5f6-4f4e-848e-3be310f62c2b","resolution":{"observed_at":"2026-08-08T00:57:30.458018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-08-08T00:57:30.462207Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.462207Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:7f63d596d637d2c1837d99d8c9e96cc34d303548e142fcce5c35c94778e35d70","observation_id":"a1838133-bd51-4c1f-bf27-58ee53ce2e5c","resolution":{"observed_at":"2026-08-08T00:57:30.462207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-07T12:59:59.342982Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-08T00:57:30.465960Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.465960Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:6ec89081940609620b42e6eb2261ad067598257a7f76ee8b85a2d43f61fe7679","observation_id":"a5c27ee9-18a9-44e4-a8f8-2f1ba7aba2c1","resolution":{"observed_at":"2026-08-08T00:57:30.465960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.469657Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.469657Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:d75d5a7453acfa05fe0d1bba17c91e7961bea4f19088ca37b18db0056e01a9a8","observation_id":"e4444bbf-596d-4703-8f07-b06a47a936e5","resolution":{"observed_at":"2026-08-08T00:57:30.469657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.473324Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.473324Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:c510990d7bfe50a9f26128e6709032be71a0423ea780a9a6e349d65e8b3f1c27","observation_id":"2407f428-d323-4c52-b40f-01f50de7819f","resolution":{"observed_at":"2026-08-08T00:57:30.473324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.21444","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.848753Z","title":null,"venue":null,"work_id":"0dbcd4ca-b86e-477d-bf53-39d32d6db8d1","year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.476769Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:47d21dff06e20b66f65e032abbbe69b9a5f973462c36466df2272586d025ebf9","observation_id":"ba4562bc-c250-46e2-b7e3-d20bcea45c59","resolution":{"observed_at":"2026-08-08T00:57:30.854553Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T00:57:30.480119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.480119Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:f43ca7cc45a8f9d80af50a95dbd5dfb2d204de5ac84cce0fd26ba93251f555fe","observation_id":"4ebe5c2a-8a41-4d26-96b6-4460b9107f1b","resolution":{"observed_at":"2026-08-08T00:57:30.480119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.484139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.484139Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:a5625c1ff7581ca3f67662f720ef49b7a03f5cc5d41e79e983df1f8b4e0a2718","observation_id":"6e233841-6b2d-4913-abe1-03758e78e6cb","resolution":{"observed_at":"2026-08-08T00:57:30.484139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-07T21:53:39.516862Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-08T00:57:30.487540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.487540Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:1fabff21bfd0705dcf57ec7aee8ff423f16e8d3bc6b63dbdfb2ac338dd96b980","observation_id":"52e9b7ae-8a61-4a64-b77f-673325afb5da","resolution":{"observed_at":"2026-08-08T00:57:30.487540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T00:57:30.491054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.491054Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:39f9991b995b3f72de875b1fc55f313c2a59392842ad61fd3ff1f4cb392debf0","observation_id":"bd697cd9-bfbe-4342-a776-d9aa8ca12e60","resolution":{"observed_at":"2026-08-08T00:57:30.491054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:31.410855Z","title":null,"venue":null,"work_id":"8f14e033-89f8-44b0-9c9c-de934d2e33ee","year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.494817Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:8d3640a2eefaf463418a1200c1f809498c0b32f47dfae506bb889e814f301c04","observation_id":"bffc2168-0b82-4e2f-8f03-a67983067e19","resolution":{"observed_at":"2026-08-08T00:57:31.414598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-08T00:57:30.498471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.498471Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:a53fda6614cac2b8a568ef551650f2ff63409781a2de00f974bcbf2560386c4a","observation_id":"c19251bb-e489-49b7-8ef3-3a65dfaf0ad7","resolution":{"observed_at":"2026-08-08T00:57:30.498471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-08T00:57:30.502123Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.502123Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:590d202761ac36bdeacc5a996750cbaf1239d43d9036aa9e0ca2dac7c40ba69e","observation_id":"0b698316-a173-408c-be4d-e7d77d98a12c","resolution":{"observed_at":"2026-08-08T00:57:30.502123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-08T00:57:30.506098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.506098Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:09f2205903cf1de5e3eedc28297e194352cb9ae0734697ab43699221b33c20cc","observation_id":"a6584d1b-77ba-405b-814e-f56b6451ac95","resolution":{"observed_at":"2026-08-08T00:57:30.506098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T00:57:30.510294Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.510294Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:7b166df427dd97c6854af4b13d6a5cbaba6e24cf3c285444d3226e5fe8c48eb9","observation_id":"f2b0c7ad-135f-4a0e-90bd-f0ec6b1178b7","resolution":{"observed_at":"2026-08-08T00:57:30.510294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-08T00:57:30.514403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.514403Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:c6aa4836c9a35ea91a6541d77bc610cceaecd863efb2fe92d82831d5185a220c","observation_id":"e31dbe6a-4007-4b9e-85c6-03f5a818230c","resolution":{"observed_at":"2026-08-08T00:57:30.514403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.518105Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.518105Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:994dcedd4a445ce1cdd3a7ec85282a8bcdd51eb2453e4097c98753bc00a662d7","observation_id":"56d7b9d6-bb2d-43c0-819b-d3f6c8771485","resolution":{"observed_at":"2026-08-08T00:57:30.518105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-08T00:57:30.521694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.521694Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:01a743e323f3d61131fd28ad2f610dffce25d84b695240d0b2822d2e592b925f","observation_id":"71176864-784a-4c8d-a116-44d3b33deb16","resolution":{"observed_at":"2026-08-08T00:57:30.521694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2508.00410","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.661575Z","title":null,"venue":null,"work_id":"62e72d6d-0689-4070-bab6-97c32f2f253e","year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.525459Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:9728ee9eb5e05982df78210807f6d5e857d04a54011f3202fba0ccd49a7ee1f3","observation_id":"5bdbee35-1a8f-45dd-833d-2f3053cbf2a8","resolution":{"observed_at":"2026-08-08T00:57:30.666565Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-08T00:57:30.529006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.529006Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:0c3562dc5a71f906eeeaee1eac96bd797ee0139a3fd354996ecb5fb7a62665ba","observation_id":"91f079ec-09f0-4ead-865f-40038c090f19","resolution":{"observed_at":"2026-08-08T00:57:30.529006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-08T00:57:30.532594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.532594Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:76288d748b85bbbae399416edabf3de906c836d610a3b75aa24407632cdf2fd3","observation_id":"a3e3bafa-9008-4732-aef9-bfd00e0bbdf1","resolution":{"observed_at":"2026-08-08T00:57:30.532594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-08T00:57:30.537043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.537043Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:8aa9a1a919e457be7c4e2ade8f76f346e752b079a6b21dc20074d07753f75fef","observation_id":"9b1374cf-3fea-4de6-aa10-19a0e09406a3","resolution":{"observed_at":"2026-08-08T00:57:30.537043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:57:30.540771Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.540771Z"},"links":{"citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:34ea8c2f9df7c1e92d34c1c3e64c1eb5ae3ad318466aeadb41742541d8111ef5","observation_id":"df8cc502-09ba-410a-9a0b-c6e8240da32c","resolution":{"observed_at":"2026-08-08T00:57:30.540771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.03119."}