{"as_of":"2026-08-04T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fca59f0a74dfae1042d74d297ec1c62e5efa03af597edd2a2286ad5e65636361","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T19:03:10.268534Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:50:58.824041Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T02:06:27.263175Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17333","snapshot_observed_at":"2026-08-02T21:50:58.824041Z","title":"Leveraging error diversity in group rollouts for reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06626","last_updated":"2026-05-24T09:37:35Z","snapshot_observed_at":"2026-08-02T21:50:53.342047Z","submitted_at":"2026-02-22T06:09:57Z","title":"Grouter: Decoupling Routing from Representation for Accelerated MoE Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:50:58.824041Z"},"links":{"cited_paper":"/paper/2605.17333","citing_paper":"/paper/2603.06626"},"observation_digest":"sha256:48a23c994b4a6818b3f926dbcc38a6799447d564a26d1ac4c4fb551a8339bf80","observation_id":"f3364cc3-5a39-48aa-8a57-b0a171f6c7c0","resolution":{"observed_at":"2026-08-02T21:50:58.824041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2605.17333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17333","snapshot_observed_at":"2026-07-02T02:06:27.263175Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","venue":"cs.LG","work_id":"137670ce-94eb-460d-9e53-44352b1e3846","year":2026},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2605.17333","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:4f6334b3fda8e3f7f431b56123f3a6f0c646b2a5eea4b538389256f35331285b","observation_id":"ba8ccdcc-64d8-4c07-b1a1-472c9b830409","resolution":{"observed_at":"2026-07-02T02:06:27.264764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17333/citation-record","integrity":"/paper/2605.17333/integrity","json":"/paper/2605.17333/citation-record.json","paper":"/paper/2605.17333"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:d7a1c1b7df03ae64f64b1b9726ff90f9f8b13050dbf48cde1023f28fc0316a18","observation_id":"4b1ba4e5-b7ca-4f4b-aed8-b5f84a16258e","resolution":{"observed_at":"2026-06-30T19:05:00.420630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.165175Z","title":"Matharena: Evaluating llms on uncontaminated math competitions, february 2025.https://matharena.ai, 8","venue":null,"work_id":"e95fcf7c-b3e4-4b86-a5bc-29c616393d18","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:9992e9bb686c32712635fdeffc8d3201a6d75be2d261031495d6a407b2449deb","observation_id":"9a366783-c26f-4655-a718-8b1a770589a0","resolution":{"observed_at":"2026-07-08T01:34:27.166592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:57.011864Z","title":"Post-training as reweighting: A stochastic view of reasoning trajectories in language models","venue":null,"work_id":"8c3af321-88c8-423e-84f7-acaa90a08cbb","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:206c952bcb36d9058547ef6de5ea6a8a458b263e00704fe4b772f51098ce2ef1","observation_id":"9a99b717-4914-450d-b475-106ec02b200c","resolution":{"observed_at":"2026-06-30T19:05:00.423181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:481717ddb1e7bf15d9bf462b49ffe9dafbea3dbc0c43168fc6212863bd565b92","observation_id":"1e6cacf5-f354-4274-8065-8e7706cdfbb0","resolution":{"observed_at":"2026-06-30T19:05:00.410488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:56:29.061325Z","title":"arXiv preprint arXiv:2505.09655 , year=","venue":null,"work_id":"f303b12c-5cef-494d-a329-b01b36477b0a","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:90277c8744c4f4b8e249fed4ef9787d25cc7cee3bb0ea46550f7f3bf555154ad","observation_id":"1ae4db99-e03f-4ad9-b81e-c18b5c139651","resolution":{"observed_at":"2026-06-30T19:05:00.408150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.167130Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":"6916d85e-5257-4119-a33d-0c0c6c56cb34","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:8373a862b65ddf540e2914ba4e1b960576867f84982710cbf5f4c78b5ca411a3","observation_id":"a087e67a-aee1-4f92-ba25-bba483404220","resolution":{"observed_at":"2026-07-08T01:34:27.168504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.546679Z","title":"American invitational mathematics examination-aime 2024","venue":null,"work_id":"4442c031-3003-4490-80ad-aebe62b930c7","year":2024},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:5a82e2632fd13124919ae3df4fa746c3089444bafbe419b2cb26049af9b9da44","observation_id":"bab5517e-8183-4245-920f-7286a4c45e73","resolution":{"observed_at":"2026-07-08T01:34:27.170368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.879372Z","title":"Harder is better: Boost- ing mathematical reasoning via difficulty-aware grpo and multi-aspect question reformulation","venue":null,"work_id":"3065ba72-7cd8-4bef-9c29-a9cdeaf219b7","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:701b79c98564a775e04cd022b3c4680ba3db15df18d739db0eb3b48313928f81","observation_id":"2ffba4e4-c132-4868-95e1-e07535b29155","resolution":{"observed_at":"2026-06-30T19:05:00.425821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05665","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:36:56.981467Z","title":"Interleaved latent visual reasoning with selective perceptual modeling","venue":null,"work_id":"d12dcb47-4b0a-42df-944f-f13015a4752d","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:fc5efcd594cd64092f7644e874c1df4d263d65605fcfb319f891657fc9db5dad","observation_id":"515a2898-7620-4fc6-917e-df207c8fe663","resolution":{"observed_at":"2026-06-30T19:05:00.420310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:5251073f30432c178217ba5abcbd1b261aba835b42df1ef27ca140fb128ea0e3","observation_id":"cd543f84-2aed-4200-a98c-9b4d694d84d1","resolution":{"observed_at":"2026-06-30T19:05:00.433031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.05118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T19:05:00.371021Z","title":"Reasoning through exploration: A reinforcement learning framework for robust function calling","venue":null,"work_id":"17ac5f84-5524-4185-9df0-e9be7d77267f","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:674938ca8a391c45da900209570e1c114cc71c0654565610641657bc4884d7f8","observation_id":"be741e74-6ada-4578-b50d-cafb9fb6b427","resolution":{"observed_at":"2026-06-30T19:05:00.372591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.161234Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"3dfe4141-a0a1-4147-a19e-40a523885251","year":2024},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:05ad1c23eca21dd7c3b10bf73dc9118e3185cfda309dd26a4babdfc9db613f89","observation_id":"7640a5c3-5593-45b7-9692-81e770d0db2d","resolution":{"observed_at":"2026-07-08T01:34:27.162531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:0ca38282a31531552d65caf13651af32211105f43f3c583b792358bb256eddf9","observation_id":"ca3964a8-5ba9-41df-9c34-a73d013d2318","resolution":{"observed_at":"2026-06-30T19:05:00.388344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:3969dcc4c95d480f894f9c3a991346be295ed9741fe6ca1611b3cbc3a13485eb","observation_id":"bd7e061d-91b4-4aae-bd34-9b09ef6de84e","resolution":{"observed_at":"2026-06-30T19:05:00.413123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T19:05:00.434454Z","title":"Setpo: Set-level policy optimization for diversity-preserving llm reasoning","venue":null,"work_id":"53128455-88c0-48cd-8ca7-2ddc441a8517","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:0aca52dcbd1b418a1901509ecc20a69b7e347babd4354f897c40298306f29574","observation_id":"7c1f0d5b-7377-427c-ab7f-b81e6b50be0e","resolution":{"observed_at":"2026-06-30T19:05:00.435940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:9d6398ea870e9f451848029be3b90e25c6f6ddb01626d11b39ce8ab2311f5520","observation_id":"72e8effc-8268-4ac5-a301-fd26280d3594","resolution":{"observed_at":"2026-06-30T19:05:00.425260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T15:25:03.930996Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":"b25e90fb-173a-4c53-8e7d-dd60c163b55d","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:c9b892f89e5b2100ea60265c719ab75837502a516607016fc9491ff1a5a46c2b","observation_id":"828c286c-4b7f-42bc-bc3b-e780b5ada7e6","resolution":{"observed_at":"2026-07-08T01:34:27.159023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.159582Z","title":null,"venue":null,"work_id":"f2dcd885-b6c2-42f4-9ddf-430dce15089a","year":2023},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:890832aa420a8f24bd43aa8f9da8e48571a7e48cb48ea4ba3e4e1beba5b7e6b3","observation_id":"36188bb1-2d4a-41c3-a9a1-e14b8d9f3a4f","resolution":{"observed_at":"2026-07-08T01:34:27.160665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.163099Z","title":"Diversity-aware training for test-time scaling","venue":null,"work_id":"dd48d031-13d4-41a5-b122-b134b21f6ce9","year":null},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:6a4e3a85d1b60ce8f1ff5e6e80c4a7ae201d2bae211fce6eaaab2499248121a3","observation_id":"8d5fe6b1-9741-47ca-ae9e-077feedbf07f","resolution":{"observed_at":"2026-07-08T01:34:27.164596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:20.677876Z","title":"American mathematics competitions - amc.https://maa.org/","venue":null,"work_id":"e5323339-791f-4b79-b45b-7fd9c09d073d","year":2023},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:601ef34c504cf3dbcf389dbbf2a6d39d1537aee0935a2f1c6e607e4439c51e89","observation_id":"5a8455af-7cf7-42a6-b624-df92f5cbc661","resolution":{"observed_at":"2026-07-08T01:34:27.155163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.155745Z","title":"American invitational mathematics examination-AIME 2025.https://maa.org/","venue":null,"work_id":"37af9f84-91fb-4553-a68f-bf1e8b0978f4","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:790172ef6120598ef7b0a53f8027dd05a0c7bb2ea4f818c8728b0af8abee4057","observation_id":"73a0841b-21a0-4296-8266-2b0c081e654e","resolution":{"observed_at":"2026-07-08T01:34:27.157135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.151975Z","title":"American invitational mathematics examination-AIME 2026.https://maa.org/","venue":null,"work_id":"c85f1ab1-24ff-4849-96b7-3094f559fc62","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:456593ff8672d7fd85c8256228c3fcf1bb8eed55bcd9fc2d329a1207315f0841","observation_id":"0b0e6343-3c06-41c6-9278-e0671f7d8c48","resolution":{"observed_at":"2026-07-08T01:34:27.153189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.383492Z","title":"Ngrpo: Negative-enhanced group relative policy optimization","venue":null,"work_id":"7cb63f10-8256-482c-8454-eebe075b7bfe","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:5714530f8ef18ec324b753a6642e31fe09e1be545d24e00b71d7e56c6be42863","observation_id":"a2c47669-c47c-4152-b605-5bb3e996df66","resolution":{"observed_at":"2026-06-30T19:05:00.402722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-07-31T19:08:41.925451Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-07-10T19:57:34.141445Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:6e1a2918a0f9bcfefc87bd213827e89f3b542d0484880b6dd32d25e2f7cd5ebe","observation_id":"d0b9eb4a-8f38-4e2e-b05c-42ed6bf2bafe","resolution":{"observed_at":"2026-06-30T19:05:00.422916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:c7a853732ae773d2cfcf459f9ba935884adcad9ee78166ba957f2c4d05e04f1d","observation_id":"a8602bf4-fdd3-43d0-81b9-7ac7c85e116b","resolution":{"observed_at":"2026-06-30T19:05:00.430705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:b202cb31d9b89358f4716a70cfbae1d99c12306541c84f751f0725acde3aec81","observation_id":"7b6013b6-fc6d-4461-87c8-9f57e21f19c5","resolution":{"observed_at":"2026-06-30T19:05:00.394706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":"2505.15201","doi":"10.48550/arxiv.2505.15201","metadata_source":"pith","pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Pass@ k policy optimization: Solving harder reinforcement learning problems","venue":"cs.LG","work_id":"89595483-89ea-4826-91ac-09421f814681","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:5db1298a602dbf872447edd8927b64b1889699cb5796050c1bbd8f17d1f9f552","observation_id":"adae003e-4066-4f99-a89f-c9ac8719bf8d","resolution":{"observed_at":"2026-06-30T19:05:00.378626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:53:19.113534+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:53:19.113534+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09085","last_updated":"2026-06-07T02:50:09Z","snapshot_observed_at":"2026-08-03T10:46:42.013201Z","submitted_at":"2026-01-14T02:35:19Z","title":"MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting","version":2},"cited_work":{"arxiv_id":"2601.09085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.09085","snapshot_observed_at":"2026-06-30T19:05:00.399910Z","title":"Mmr-grpo: Accelerating grpo-style training through diversity- aware reward reweighting","venue":"cs.LG","work_id":"db51764f-53cb-4717-88bb-0dff6fa0d88c","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2601.09085","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:63a3d5cc50f70883417b856cb63f8bfa5a3af06833573405b80ae52be0f302b2","observation_id":"21f9fa6e-f89d-41a0-bc2c-22798f808b0d","resolution":{"observed_at":"2026-06-30T19:05:00.401145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10649","last_updated":"2026-04-16T14:51:36Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T15:06:53Z","title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","version":2},"cited_work":{"arxiv_id":"2510.10649","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10649","snapshot_observed_at":"2026-07-03T23:39:04.403292Z","title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","venue":"cs.AI","work_id":"fae790a0-f18c-4992-8eb6-b217c5ca1041","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2510.10649","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:377b3565b2dc193fd61e9f8f9a0740b298e52e29714fdb105587930d6dfac834","observation_id":"1b62b345-12eb-4937-b131-b52703c3bcec","resolution":{"observed_at":"2026-06-30T19:05:00.415466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.06626","last_updated":"2026-05-24T09:37:35Z","snapshot_observed_at":"2026-08-02T21:50:53.342047Z","submitted_at":"2026-02-22T06:09:57Z","title":"Grouter: Decoupling Routing from Representation for Accelerated MoE Training","version":2},"cited_work":{"arxiv_id":"2603.06626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.06626","snapshot_observed_at":"2026-06-30T19:05:00.368304Z","title":"Grouter: Decoupling routing from representation for accelerated moe training","venue":"cs.LG","work_id":"3e2ab3e9-8cc0-4960-8581-f6ab052ebbce","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2603.06626","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:82a9ff4f2d94614c1b65eb1e7248a20d8c6cbe86b4aee2b86f1dff3996aa4c5e","observation_id":"90f96817-8764-417f-915d-28ad14c00973","resolution":{"observed_at":"2026-06-30T19:05:00.369568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:5e7efd687250536133ab49c7d7668bdf6d08a30b4cc0ec62872f559d3a947e62","observation_id":"43f199f6-69b9-4a14-ad0a-0185143ee4d6","resolution":{"observed_at":"2026-06-30T19:05:00.408984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:6a92d49f4b5418cb021f6ae98169c51fd9a5f6f3e7928a4ad855790cd835cfb5","observation_id":"19724671-9237-4f97-9bd1-03974b406884","resolution":{"observed_at":"2026-06-30T19:05:00.428210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01174","last_updated":"2025-08-02T03:25:26Z","snapshot_observed_at":"2026-07-06T22:06:38.785781Z","submitted_at":"2025-08-02T03:25:26Z","title":"RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.01174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01174","snapshot_observed_at":"2026-06-30T19:05:00.410095Z","title":"Rspo: Risk-seeking policy optimization for pass@ k and max@ k metrics in large language models","venue":null,"work_id":"7e371313-fc9e-4c13-8f1d-a50edcb8d14b","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2508.01174","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:d823db81bd91b4a813fa8e1446781bf634595da80b68d606f32a833c26a8b4df","observation_id":"522341bc-f461-4681-81fb-fff501ead888","resolution":{"observed_at":"2026-06-30T19:05:00.411604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-07-06T22:04:35.202101Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:2b059b5402a760c8ec4624efe3e5f51927ddbce4ce389da8548852994fd05316","observation_id":"89914b81-2235-4847-bb65-3a9f4ecd70db","resolution":{"observed_at":"2026-06-30T19:05:00.406585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05053","last_updated":"2026-04-20T12:27:51Z","snapshot_observed_at":"2026-08-02T07:06:49.271465Z","submitted_at":"2026-01-08T15:56:44Z","title":"Reinforced Efficient Reasoning via Semantically Diverse Exploration","version":2},"cited_work":{"arxiv_id":"2601.05053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05053","snapshot_observed_at":"2026-06-30T19:05:00.389635Z","title":"Reinforced Efficient Reasoning via Semantically Diverse Exploration","venue":"cs.AI","work_id":"e22813a1-e474-4942-8d41-198d93a207be","year":2026},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2601.05053","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:b87786b10ab39f448aec10e1436e0a6431fbf1a1974fab26c4f3ea3e55fe6d15","observation_id":"7fb99a93-ad11-4443-8c89-252b3c0098a7","resolution":{"observed_at":"2026-06-30T19:05:00.390998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":25,"verified_fuzzy":9},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2605.17333."}