{"as_of":"2026-08-08T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b3bec1b8ac5049a36b8c6e6fa7bc22ad2d76c8a1e399ea9ce0be7e8e84e891f","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T18:55:24.704870Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26862/citation-record","integrity":"/paper/2607.26862/integrity","json":"/paper/2607.26862/citation-record.json","paper":"/paper/2607.26862"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-30T18:55:21.700900Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:21.700900Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:d32843df4bd039aa0679d5acd6de95e0e8d516909fbf41fae0ae41cc9a7c1a6a","observation_id":"36ee635e-10ba-4733-ba6b-0eec45c02466","resolution":{"observed_at":"2026-07-30T18:55:21.700900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-30T18:55:21.873272Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:21.873272Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:e123b72cbf70fc97474c5580f5f90d2f7a143dc61453eab63ea641523286a67b","observation_id":"9ae5d31e-79c2-419c-b636-def2b10b96ec","resolution":{"observed_at":"2026-07-30T18:55:21.873272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-30T18:55:22.002180Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.002180Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:16e74f73cf853f262b09a4fec6a27a8d74a901a9ec195155e6554886c85cb2d4","observation_id":"43b9220b-7165-472a-b6c0-286b2c553089","resolution":{"observed_at":"2026-07-30T18:55:22.002180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-30T18:55:22.104338Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.104338Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:c958a3b5772b67d98fc3a384d3d26ec5967d389335329bf4ba5caf694e5a3baa","observation_id":"b8fa3e9f-60e7-4387-b3a5-bfd3b95923db","resolution":{"observed_at":"2026-07-30T18:55:22.104338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-30T18:55:22.181578Z","title":"arXiv preprint arXiv:2503.20783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.181578Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:b7673cfc09c7ddd4b85171fe94be65bf322d74445fcd9c02b1b0e5db467c2fbd","observation_id":"58fe5b67-b55e-46e4-923f-174f59638ed3","resolution":{"observed_at":"2026-07-30T18:55:22.181578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-07T21:24:19.336829Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-30T18:55:22.314325Z","title":"arXiv preprint arXiv:2504.14286 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.314325Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:d65462187633895838eb583ad0530a682fac5f40f31e3d0918797821aa26987a","observation_id":"ed222e3f-3531-41b9-ac31-46ac4fb7ef93","resolution":{"observed_at":"2026-07-30T18:55:22.314325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-07-30T18:55:22.423458Z","title":"arXiv preprint arXiv:2504.13837 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.423458Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:eaf2ef98b38f574f493e2768b80ec8157b1d95273889bcbf78063d53151b5d23","observation_id":"ad29b42b-cd8c-4bc4-a618-708d3120c4cd","resolution":{"observed_at":"2026-07-30T18:55:22.423458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:22.491650Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.491650Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:4904c2fcaeabcae1f6f507412fc9db5bd75b6893d5ca330ce1b235d7bdd9e74a","observation_id":"ce8da9e8-c794-4c53-8c2a-3604f22bef24","resolution":{"observed_at":"2026-07-30T18:55:22.491650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:22.588781Z","title":"Scaling Self-Improving Foundation Models without Human Supervision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.588781Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:04865e41c477586de57dc5b8bc2ffcffb888a4d11f4fcd8d9258333c6c5e78f5","observation_id":"a0d0488f-c223-417d-a58c-84cb1ba477d6","resolution":{"observed_at":"2026-07-30T18:55:22.588781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:22.736202Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.736202Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:0d4a11717e0fcf87ef0e0d4d976f8bd15e3bccf9a9d0b643e8dc447263d51f52","observation_id":"434575cd-3b71-4252-a29d-5e77941756e5","resolution":{"observed_at":"2026-07-30T18:55:22.736202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:22.874688Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.874688Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:950586e0642f8989443c402641de70eeb9429b99b09abd6de194bdbe6540a189","observation_id":"fee4736b-6da0-45f2-a8be-e2714af9d14d","resolution":{"observed_at":"2026-07-30T18:55:22.874688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:22.952424Z","title":"arXiv preprint arXiv:2505.09655 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.952424Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:2f2fc5497468a90d8fe644b2f8110d8d8f497148901345d061e84c559b33ee8d","observation_id":"780be7fd-0c53-43e2-9c9a-c5ada517a343","resolution":{"observed_at":"2026-07-30T18:55:22.952424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.072865Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.072865Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:8c082c8763e3d0a92f8f20e462b486ecd78067d5f89fd5bb3a40e030b8b4b4a1","observation_id":"191eeb99-0506-475b-8101-4366999c0a16","resolution":{"observed_at":"2026-07-30T18:55:23.072865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.133824Z","title":"arXiv preprint arXiv:2509.07430 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.133824Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:73eae65d6fe971d0383a3fd13ec6bb908441fa3e908974fae0c692f1de21a66e","observation_id":"b72866d7-a50a-4312-9b46-359e37ce8d83","resolution":{"observed_at":"2026-07-30T18:55:23.133824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.239197Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.239197Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:ee0b98607e5c2f1c8f55c86611f60301f3b13c983cfff90edc551c257cffc29d","observation_id":"b81696d9-ccee-42a5-a722-8987cb56c5fb","resolution":{"observed_at":"2026-07-30T18:55:23.239197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.342157Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.342157Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:4ca360dbbf13fd876c6802403145bb91ec4481c6dd7b417c4d0740bcb1bad654","observation_id":"e84eb579-e15b-48b6-9510-c07ac09dd07e","resolution":{"observed_at":"2026-07-30T18:55:23.342157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.504212Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.504212Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:4ff9df196f3cefab26221c6d40de79ea2c7c843fd33e43a28a0eb6029a9105bd","observation_id":"6a42ba9d-d073-4b21-b1c9-8c280da65eb1","resolution":{"observed_at":"2026-07-30T18:55:23.504212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.598952Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.598952Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:562729ca1e6cdf46cbeda50af90170d6fd6593cde3ea87d4549a5a3698afc3f9","observation_id":"d0041b5e-e79d-4083-9b95-92b4129e84df","resolution":{"observed_at":"2026-07-30T18:55:23.598952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.720917Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.720917Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:9a49125a6cc8aef749f37ce2e83903b802a2bec1b663071214dae235b5a4f39e","observation_id":"50089795-b9ae-4c96-9b48-dc2bfb934d7a","resolution":{"observed_at":"2026-07-30T18:55:23.720917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.822828Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.822828Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:5563fa74a2477997ef014937c545c97d4590ba9f4154529b88fe435a98079c7e","observation_id":"0bc25166-2071-462f-8122-890dd3942082","resolution":{"observed_at":"2026-07-30T18:55:23.822828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:23.910914Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:23.910914Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:27f73b3040e5efeb3e4bd3949f2a0202fbef6474b649c1e11e8d69140eb01272","observation_id":"e2c19e1e-c006-49ea-9b6f-e80b35b1d6c6","resolution":{"observed_at":"2026-07-30T18:55:23.910914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.004909Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.004909Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:d61369fd1f7b951f0859da06910791e4ad875c572090d253cb60c0b520914418","observation_id":"e3ccbeea-bfc5-4252-954e-e82a2436b563","resolution":{"observed_at":"2026-07-30T18:55:24.004909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.060787Z","title":"ACL , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.060787Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:8df404fd8593b2fda879e930509173ebc6343724beb7645990ffafd5aaae3192","observation_id":"4730c6ea-1fdd-4720-9f5a-d811d35db3b8","resolution":{"observed_at":"2026-07-30T18:55:24.060787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.130714Z","title":"B leu: a Method for Automatic Evaluation of Machine Translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.130714Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:d99e8e5ffd179e99c4337021b9a87a804a129c63556e53150c2fcf93b95da7cb","observation_id":"a23ce882-a698-4da9-ab46-6a3b5306c231","resolution":{"observed_at":"2026-07-30T18:55:24.130714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.234751Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.234751Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:1e9deb4028f8ec2e6544a066b5a701a5caf585e1d5720b9eec44b6ced62d453d","observation_id":"1f53dfde-3bc5-4f13-8a4b-da7f62693e9e","resolution":{"observed_at":"2026-07-30T18:55:24.234751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.296151Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.296151Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:b4837e0081fe8f6fb62be15beb75220e7e2908b24916949480a77a2ef3e380ed","observation_id":"7ffeb59b-a87f-4fd6-939e-a3021677eed3","resolution":{"observed_at":"2026-07-30T18:55:24.296151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.378315Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.378315Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:660c8f3a577da17bce458fd0a9e619025ce8c1ed2e381c77f90a245ffb30a001","observation_id":"f5ba9647-8f1e-4246-91e5-7b883bac71f2","resolution":{"observed_at":"2026-07-30T18:55:24.378315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.446453Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.446453Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:51cda8d2f33ce3c8ff8842a68296d7a3f88879f47e6b49bfd0a006e31cccac0b","observation_id":"d3b350f6-f86e-4b0d-a614-6c640bd6e55d","resolution":{"observed_at":"2026-07-30T18:55:24.446453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.530280Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.530280Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:1ca99989335cdfb7351c4aeb175c29513ef7f2950909e71cddfbbb313d094d5f","observation_id":"1cafb247-0497-45bb-b7f6-e437ea2e72bc","resolution":{"observed_at":"2026-07-30T18:55:24.530280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.615112Z","title":"Proceedings of the 2016 conference of the North American chapter of the association for computational linguistics: human language technologies , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.615112Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:4d43be61650323eb683a3102170fb0342ce43614bbb63d8d50d79054ce1f17af","observation_id":"d04798b5-82ee-4f31-aee8-60db5b553ef6","resolution":{"observed_at":"2026-07-30T18:55:24.615112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:55:24.704870Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:24.704870Z"},"links":{"citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:605c0b8683b09f0431de9a7b2aa23f958e12ede30f713cc988e94be65760b111","observation_id":"a660cd40-cb7b-4d9e-8d91-197152338964","resolution":{"observed_at":"2026-07-30T18:55:24.704870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.26862."}