{"as_of":"2026-08-08T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:762f77cb6223c00af4dca24de98d3911a492f7f3770a4154ff4faa8a45679bb7","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:56:39.465133Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:54:44.345264Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T21:54:44.621660Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"cited_work":{"arxiv_id":"2605.00365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00365","snapshot_observed_at":"2026-08-04T21:54:44.621660Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","venue":"cs.LG","work_id":"69d9856f-c296-4ab9-a0a8-20dea8d3ac08","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T06:30:11.819425Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.345264Z"},"links":{"cited_paper":"/paper/2605.00365","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:e6acf00eae152bbb5245cde66dfb312aa0bb29d9256474d8a7cf612740fee8e3","observation_id":"490492f5-7b91-4f81-b8db-d1e281bbd6c6","resolution":{"observed_at":"2026-08-04T21:54:44.626662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.00365/citation-record","integrity":"/paper/2605.00365/integrity","json":"/paper/2605.00365/citation-record.json","paper":"/paper/2605.00365"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature , year=","venue":null,"work_id":"3860734b-4b29-41dc-adea-0a95361316f0","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:1a74a82fc812629398d274d3c5c4321d4c454ea8c536931fbbbfa4ee156414c0","observation_id":"8c63f10a-6c93-4e41-b446-d0fd7b3d0cb2","resolution":{"observed_at":"2026-05-24T15:46:16.336237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.813628Z","title":"2024 , eprint=","venue":null,"work_id":"a89a4563-79a1-421b-94b6-2cf0795d3c66","year":2024},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:9bc50af913e333398d0d62df3d0aac7ee0b36c833d24259fea87c264b1c6a057","observation_id":"ed441f2d-4a7c-4f56-8876-1442f660c6dc","resolution":{"observed_at":"2026-05-24T15:46:16.344229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.15609","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2601.15609 , year=","venue":null,"work_id":"c598e1a1-413c-4956-b48c-9cf4cae26cf9","year":2026},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:5e82d3bddccfdca8a3a2ca6e450764fa8225043b32e59550bd42862eccadfaca","observation_id":"c80f782c-49df-404c-ac90-0055ef923aae","resolution":{"observed_at":"2026-05-11T15:26:16.745333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.096579Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"c25e8154-fab2-455c-8a26-56e40aed5d2b","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:9dc12c53345c5bc07a546e174ccdf980651a94db6e180faba4752e877cfdad91","observation_id":"f08b654c-3f9a-47fa-a0a7-ad00e088a2ed","resolution":{"observed_at":"2026-05-24T15:46:16.340306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.100694Z","title":"2026 , eprint=","venue":null,"work_id":"7bc09928-b2f1-419d-82ce-be2c01e956fc","year":2026},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:2bb90afe7ab8014b1addcf600ac4e00e62253191200babbb651612c90def7f21","observation_id":"c695e834-270d-4a59-82a6-38dbfe8e6e63","resolution":{"observed_at":"2026-05-24T15:46:16.332258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.19849","doi":"10.48550/arxiv.2507.19849","metadata_source":"pith","pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Reinforced Policy Optimization","venue":"cs.LG","work_id":"6cb0d241-5e4d-44ed-9476-659819ec0681","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:0ed82616cc17675a39c7125068356cb696e96a7a7f8711d28e9929ba562a0068","observation_id":"537ecb71-4d46-4791-93e6-b26b58eb06c8","resolution":{"observed_at":"2026-05-17T02:57:12.173630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.1298","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","venue":null,"work_id":"ed7ff3b1-504b-4299-b135-fc274faebac5","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:3899e5c3fb06595cc484f0e1328fb605dde98a09dec4a1565cfd4e59874b08bb","observation_id":"a14abe58-6121-4983-9cbf-3aae2077b979","resolution":{"observed_at":"2026-05-09T20:01:36.736368Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.299960Z","title":"arXiv preprint arXiv:2509.25133 , year=","venue":null,"work_id":"27ca51ae-e57f-4f13-9b0c-155064ec727b","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:814222e8dace10cc0008ab43ff72388781441195e0df9eeff754ee4a759c4a8a","observation_id":"e9ddb812-b7d7-4af8-838d-3c78e5830b14","resolution":{"observed_at":"2026-05-11T15:26:16.537353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.104674Z","title":"2021 , eprint=","venue":null,"work_id":"0d46a05b-859d-423c-ae95-e7bb4f120561","year":2021},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:e1783f689ca09f6c40db5648904950328ff93ca63f511aa426c2d9b683e502b5","observation_id":"d9c90e26-a085-44e3-9e8a-ea9752a63180","resolution":{"observed_at":"2026-05-24T15:46:16.348374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:43:50.477082Z","title":"Diversity-incentivized exploration for versatile reasoning","venue":null,"work_id":"846fe449-c3cf-44da-a88e-6acd249d801b","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:bf39cbaa8806c0c9e162e74e77ddad843977c370bfb8983cc437bcd0682e40fe","observation_id":"24de10b9-817f-4028-82f3-d3a849216c59","resolution":{"observed_at":"2026-05-11T15:26:16.815429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:42:44.618523Z","title":"2025 , eprint=","venue":null,"work_id":"b0ef8b31-6996-4e7c-95d8-b6971da7fc77","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:8e24658e8c67c5298deac2f080cdf1385eb6c22eab24a42a6399eb3ef37deee4","observation_id":"54e1a03b-6357-4945-85a8-13093bc99c7f","resolution":{"observed_at":"2026-05-24T15:46:16.328843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"703a2557-2cbd-43f3-8a5b-92fb84f3d6b8","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:b624de7c7640c3207aacc943b79902ca96fff486620a6800caa051d300bbc8ac","observation_id":"84330745-ad0b-4b9d-ac2b-3be2bc8f9003","resolution":{"observed_at":"2026-05-24T15:46:16.310540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"31db54b4-16d3-4a6e-a6ba-3fed2cfa6967","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:f71fe5b46a4bdd53ca244a38ce2f678d5783122ce6d05c03477b58b5e94a9cf2","observation_id":"e32dc371-2dc2-44a8-9eff-409e458b0ba4","resolution":{"observed_at":"2026-05-24T15:46:16.314034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"47c85fcf-cfe7-4374-95df-d1f24a9f5602","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:f5a92131e97f35709377a63ded5fcc054db095318925af2507e9eaac5d158e5f","observation_id":"1a7e5f71-1920-4c91-8646-0bd053605a74","resolution":{"observed_at":"2026-05-24T15:46:16.300557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":"2510.14901","doi":"10.48550/arxiv.2510.14901","metadata_source":"pith","pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","venue":"cs.LG","work_id":"56a35230-70da-4209-8bd7-899023fabb1b","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:819a51274421b1cf18674b29fe8a5e35bf84a83575cffb767f4efe210dfd1130","observation_id":"ffe8d3ad-fd93-423f-9af3-dca52795b780","resolution":{"observed_at":"2026-05-17T03:16:05.617665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18573","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:56:13.636692Z","title":"Enhancing efficiency and exploration in reinforcement learning for llms.arXiv preprint arXiv:2505.18573","venue":null,"work_id":"ec084a16-d8a8-4d30-9e34-4f77561d0ba4","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:1cac1b0af5e502f96c33acc7452d7f542fef0b9939e73b4a25f3ef9ffdbb809a","observation_id":"8622f2a9-dbf4-40ce-a373-990bef82e04f","resolution":{"observed_at":"2026-05-11T15:26:15.845341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d67d2767-1674-4a3c-bf73-60a9e4ab089c","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:26bfaebe05613a8525e9f871ae3e31f68877dfd5d3f776a6fddd6155077bd99d","observation_id":"b171ce6b-071d-4c54-8e73-8c5ae6b9eccf","resolution":{"observed_at":"2026-05-24T15:46:16.283159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Notion Blog , year=","venue":null,"work_id":"6009c5c9-6dd2-43d6-a941-2353e8112bf4","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:f1a2711cd320405f6417b7090c7b93f022f83253556788aed3d843da78994a9a","observation_id":"04663399-ea7e-4ef9-b83e-8582e627ac35","resolution":{"observed_at":"2026-05-24T15:46:16.263225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:42:44.599455Z","title":"NeurIPS , year=","venue":null,"work_id":"94a2c2a8-689c-410b-ae59-f2cd5993fcb2","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:fba50d017d8a71df01138f158eaca1963a4d41e5445487f4dabf9f7585960386","observation_id":"984540f4-233e-4855-ab98-9c3de7490746","resolution":{"observed_at":"2026-05-24T15:46:16.279733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:7a3c2b40f0573b7a62d522f147badf5bbad3523abbac5911efdffb1013eabfc5","observation_id":"282031cd-6c11-4d82-b87c-0e9cc8b09057","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:8c1e782824c9e31cddf3208a75a92a623d6ddd91db2c7f61d873e87d717699d0","observation_id":"f2bb6b0f-2b72-42da-aa49-42e91c9e71fb","resolution":{"observed_at":"2026-05-11T15:26:15.514567Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:42:44.596304Z","title":"Bowman , booktitle=","venue":null,"work_id":"2722cff4-b4c4-46ea-b763-f7cfc460fdc5","year":2024},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:3eda36b0bcccb540c4de9c1a516e177afba43848ac66561b504a8c968334bd4d","observation_id":"eb631d45-676c-41d6-adb8-2f2b66495092","resolution":{"observed_at":"2026-05-24T15:46:16.286498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:52:52.358673Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"3c9bea88-09c4-4133-96a0-b424254cb2ca","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:cfdeec51402ad0e679a3ec314c384e7cc35c18cac261a41ed6156936385b7234","observation_id":"bc507de8-a56e-4be9-9afa-962b35aa80f9","resolution":{"observed_at":"2026-05-24T15:46:16.290106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:25:37.824930Z","title":"Qwen2.5: A Party of Foundation Models , url =","venue":null,"work_id":"22515bae-5281-424a-a494-4f952e1ee0c3","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:1c5f0941cb2d6abf67e24fd060494e6f72405480f00436dcbad278597bdefbfa","observation_id":"8a1c6b22-a6c6-4cc4-bae0-0713e68beac9","resolution":{"observed_at":"2026-05-24T15:46:16.293524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d2f08d47-4703-4d46-ad39-a08e0df8520c","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:20a9cf8f2f2b798e6b48eb80029f95304c21d6c0e988cc9d6563aec0d4563ed6","observation_id":"cd0037da-7843-47a4-9362-e2b42f68043d","resolution":{"observed_at":"2026-05-24T15:46:16.307351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:f7042db52baff66de3035cbc6a8d4da11c10989eef0a6e4b4b364d08df5d3b9d","observation_id":"6f9a438e-d767-480b-9e90-66e45d68f524","resolution":{"observed_at":"2026-05-11T15:26:15.655822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:54.149979Z","title":"Differential smooth- ing mitigates sharpening and improves llm reasoning.arXiv preprint arXiv:2511.19942","venue":null,"work_id":"58416bfc-a305-46a9-a2c7-0c0e5f94db45","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:d5d12bfe0e42db56cf914534716518ffba620640a5eb78fad9dba54ae9bc0173","observation_id":"784e7443-325a-4bcf-9740-4902538e4ec0","resolution":{"observed_at":"2026-05-11T15:26:16.118404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions on Machine Learning Research , volume=","venue":null,"work_id":"0fa4cbcf-1459-4c93-9487-e9cc3040d4e5","year":2023},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:51529dda75c2789d9d607a5b0f22094512f314b6b782fe7706788fef18620148","observation_id":"820c6cfe-775d-41e3-8e00-a5fdce9977f2","resolution":{"observed_at":"2026-05-24T15:46:16.304077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging Face repository , volume=","venue":null,"work_id":"e547af6b-ea8a-4879-b17e-a3f0238449ae","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:abd909f2f7fcf2309db45a9ef66a8875060a1a628da94e2c98308cba9d30ccd0","observation_id":"de914d03-9ffa-4678-a00e-b646b81acce5","resolution":{"observed_at":"2026-05-24T15:46:16.266979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:56e7c7d75587516a6f1d1f24eff1ce80758ab4b33f336f05040432d8859490c0","observation_id":"65d3827a-0af7-4dd5-8a12-8ecfc1a8951b","resolution":{"observed_at":"2026-05-11T15:26:16.344559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.880105Z","title":"2025 , eprint=","venue":null,"work_id":"23c9ed8b-0801-487e-b54b-89ecae58740e","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:459b8890ca39c40c9530f2b7be40e108119a41212dfa51d829c448573bae75dd","observation_id":"0171a140-eb49-405c-851a-3a052f9101c8","resolution":{"observed_at":"2026-05-24T15:46:16.270368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:e80276fe9bf2e66805beb6571cd289c84fca5feb9867271df8ccd5bc65b4010a","observation_id":"7081bfc4-1cd2-4b53-9ab6-7d92e432a443","resolution":{"observed_at":"2026-05-11T15:26:16.276142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:18662084ab36b255f921e0fc8b158d189009f7fe66c672e1de7b3c51aa3074db","observation_id":"9ebee529-2a35-42a0-acdf-3447cf0af6e0","resolution":{"observed_at":"2026-05-11T15:26:15.994525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:4da435fe619b82d31a62a24c51a160ab38ffc65ee808c188a57a284c53ba74ae","observation_id":"e9ba9776-59af-4dd6-a264-345e83e61ca9","resolution":{"observed_at":"2026-05-11T15:26:15.760359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21128","last_updated":"2026-05-27T07:06:43Z","snapshot_observed_at":"2026-08-04T15:01:28.565478Z","submitted_at":"2025-09-25T13:18:57Z","title":"RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs","version":2},"cited_work":{"arxiv_id":"2509.21128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.21128","snapshot_observed_at":"2026-07-03T20:38:56.023469Z","title":"arXiv preprint arXiv:2509.21128 , year=","venue":"cs.AI","work_id":"18d16a89-d985-4024-84ae-2ad486fd7ebe","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2509.21128","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:c21241615e1a7786b990d60c57897d453b865860ce385d6bb46b5fd6ca1dc115","observation_id":"1c77f848-df2a-4b1f-84ae-2047ba73f338","resolution":{"observed_at":"2026-05-28T02:04:10.066146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:8c8ff9dc5cfc66eaccf303b4915df67161b500b76d0636df4ea3f07df9f45eb4","observation_id":"bc8eb1c4-2005-4bcb-8c0a-d00995cf9619","resolution":{"observed_at":"2026-05-11T15:26:15.307690Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACL 2026 , year=","venue":null,"work_id":"b4769c15-4673-4cae-a5c7-5611bef956d4","year":2026},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:c8f7da361f1412eaef87e0df5c0c245901d02de68fa34f16ebfdc2efbc396abc","observation_id":"7b16acb1-5208-4a5e-b25c-d926a4b56189","resolution":{"observed_at":"2026-05-24T15:46:16.276015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:01:19.424889Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"b2df663d-da71-4df7-9177-dbce11bcd8e5","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:5cdc320d91423723d3ace2f3fe0a95c15e4f2854c0a96b07c7db37ccd6fe0dc9","observation_id":"3633c4fc-9d87-493b-af8a-864014a4dd39","resolution":{"observed_at":"2026-05-24T15:46:16.297164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:32:42.732530Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"aba38d90-a03c-43b9-a4fe-4196a7bf7a61","year":null},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:e482f6ef82530918590a972b604401e2a9da3ef31f27e83a0c965204d8cdb779","observation_id":"ad0f8c17-b2b0-4238-9e09-7a9f03c753de","resolution":{"observed_at":"2026-05-24T15:46:16.317613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:21:22.323468Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in","venue":null,"work_id":"68128a94-4765-45ec-b3fa-ec4680de1d63","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:602b7c9ced878a7227a3af20b1d7691f6a94bbed9c648e8e2956d35aeab77a54","observation_id":"1549946c-0990-42cc-9b04-83df2f79463d","resolution":{"observed_at":"2026-05-24T15:46:16.322214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"50b4dbe8-2007-4fa5-a716-ad3106f307e1","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:f6ed1fbcb34f15e9396aa6a435ab366b0bc8685712ebfb94fe8700409ff017af","observation_id":"ba8c1a5a-9146-4eaa-97a1-427fb0dae1fc","resolution":{"observed_at":"2026-05-24T15:46:16.325558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:ae30c2a3f5f87e979246b395b142e64f0a380c72b89abe09e32d9355f3bd5a11","observation_id":"405b115a-8a38-42b3-add9-9e8eb14af53e","resolution":{"observed_at":"2026-05-16T06:20:56.524904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06717","last_updated":"2026-05-25T07:56:54Z","snapshot_observed_at":"2026-08-03T03:54:58.967423Z","submitted_at":"2026-02-06T14:07:30Z","title":"F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare","version":2},"cited_work":{"arxiv_id":"2602.06717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.06717","snapshot_observed_at":"2026-07-03T21:08:57.673167Z","title":"arXiv preprint arXiv:2602.06717 , year=","venue":"cs.LG","work_id":"3c5a2ba3-db2e-4b58-a07e-1c4cb174c272","year":2026},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2602.06717","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:94542ced81205f1d4763c75ad153004d725967c984910e07bbda53230d49504c","observation_id":"025d54a3-7039-44ad-a8b4-e51c809af7c7","resolution":{"observed_at":"2026-05-26T03:04:11.286378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":24},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2605.00365."}