{"as_of":"2026-08-08T02:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f1be12c50541f058fe193ba38d89a3a7783c1a3ac82ef94cb291fec18013af2","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:34.013794Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:34:06.517190Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T15:16:09.090199Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18830","snapshot_observed_at":"2026-08-04T09:34:06.517190Z","title":"On the effect of negative gradient in group relative deep reinforcement optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T09:34:06.517190Z"},"links":{"cited_paper":"/paper/2505.18830","citing_paper":"/paper/2510.14807"},"observation_digest":"sha256:7ae2309da05d3c77c7ddb0885cc9f2365a0047e8d871ea6c857d9443743e65da","observation_id":"151aac32-085e-47ea-a121-e760e2719af9","resolution":{"observed_at":"2026-08-04T09:34:06.517190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"cited_work":{"arxiv_id":"2505.18830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18830","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.18830 , year=","venue":null,"work_id":"81875d2c-e026-402d-8335-a2bc0ed57719","year":null},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/2505.18830","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:117c2daf0ea04aa6712b4661044da64138f09ac1f953ffff6b541d99c31becf2","observation_id":"89a73c6b-0b37-423f-a8fd-f01398c0874b","resolution":{"observed_at":"2026-05-11T15:16:09.093200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18830/citation-record","integrity":"/paper/2505.18830/integrity","json":"/paper/2505.18830/citation-record.json","paper":"/paper/2505.18830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.082862Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning.arXiv preprint arXiv:2504.02546, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.082862Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:476bc31319a4544d48d5620b62bb65bcf3de0777305b1f17c8676679c9503eef","observation_id":"1c2ffe78-a13b-4ec9-8192-4f7d15c71d18","resolution":{"observed_at":"2026-08-07T14:29:30.082862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09344","last_updated":"2025-04-20T20:53:39Z","snapshot_observed_at":"2026-07-06T19:32:10.826706Z","submitted_at":"2024-10-12T03:21:58Z","title":"DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models","version":2},"cited_work":{"arxiv_id":"2410.09344","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09344","snapshot_observed_at":"2026-08-07T14:29:34.429940Z","title":"DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models","venue":"cs.LG","work_id":"2aa3f133-b6e9-4b60-9bd3-cd3429b52f34","year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.182581Z"},"links":{"cited_paper":"/paper/2410.09344","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:597010b9048961cda3484de7f2ee120e4c91e2a9cd42a1133fa495833998097b","observation_id":"3519a9e7-04f0-4dbb-8464-61e670ba6ace","resolution":{"observed_at":"2026-08-07T14:29:34.477945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:29:30.352756Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.352756Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:88d82ed5663e5f5933f559120af4aea0708380323ac023cbcfaf68f1eac0ee6f","observation_id":"b8da91cd-c47c-4176-8984-193b2cd7c071","resolution":{"observed_at":"2026-08-07T14:29:30.352756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T14:29:30.472429Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.472429Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:73f8c5adf05586e2f9229859af9553f4395e663e6064eed40df5b252e69db734","observation_id":"0086d934-0735-4c00-b015-e426cf4b1793","resolution":{"observed_at":"2026-08-07T14:29:30.472429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.679580Z","title":"The local elasticity of neural networks","venue":null,"work_id":"fb461c6d-a152-47ec-86e1-45e64f26d755","year":2020},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.598230Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:43e06290812ef9f2ed44ce4d3e7ea83e4d9b99ed83ec3a9e137313d9a4804fda","observation_id":"ac04d9fc-c2c3-43dd-8890-51ecedb29804","resolution":{"observed_at":"2026-08-07T14:29:35.731705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.787987Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.787987Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:8c30fdb7bcb76bb6f7fc2be8b6c6031f7fcbbcadcb458101b046fb83e85a6624","observation_id":"4e9a462d-48e0-493d-a2e0-c32b91e59503","resolution":{"observed_at":"2026-08-07T14:29:30.787987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:29:30.979686Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.979686Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:c3ae130f283ccc0363ab93b0de0dc6f77cdea817251cf8a28d61e32a4b9c665e","observation_id":"01ee2673-2467-4663-a4dc-fe0a0a5ef0a9","resolution":{"observed_at":"2026-08-07T14:29:30.979686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:29:31.111041Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.111041Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:8f5f91f3282cfc48204e74f67c1a5e27190053b073f04e1337c578ed9ece01fa","observation_id":"e5e4e96a-22cc-4bcf-a91a-88ad472cf7c5","resolution":{"observed_at":"2026-08-07T14:29:31.111041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T14:29:31.259139Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.259139Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:69d881887db5150f9d3026a225bc738a5d0ce0ce6bd9723423360d9722796397","observation_id":"2e95c004-02d1-453c-956a-8e17c1eb7a31","resolution":{"observed_at":"2026-08-07T14:29:31.259139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.370676Z","title":"Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models.arXiv preprint arXiv:2503.13939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.370676Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:64cfdcb55a5f7a37039fe51aebced91b102dd427fc517323cdbebe90abe07172","observation_id":"0213d9c1-098d-47b5-98e7-bc3263b303e9","resolution":{"observed_at":"2026-08-07T14:29:31.370676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.497301Z","title":"Solving quantitative reasoning problems with language models.Advances in Neural Information Processing Systems, 35:3843–3857, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.497301Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:c0de8ae57ce2af4861eb1c6a1e954fe5a3b205438159364f191e9fc12c069fa2","observation_id":"287758ef-d131-493f-a2a3-6fab4b88f346","resolution":{"observed_at":"2026-08-07T14:29:31.497301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:29:31.672136Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.672136Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:8eeccfd9f8149829b43601fc560f694b77d08e031aecb6c095b965ceeab17f55","observation_id":"9138a9b8-c697-454e-9c8b-b2c04ae9b2f8","resolution":{"observed_at":"2026-08-07T14:29:31.672136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.844838Z","title":"Deepscaler: Surpassing o1-preview with a 1.5b model by scaling rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.844838Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:67edd6f35741ecc2e6a7e35332ff3134b11168b2337dfc5279f2834cd8ec707b","observation_id":"4bbda4f8-5219-4a63-b4d3-aca75d7097e0","resolution":{"observed_at":"2026-08-07T14:29:31.844838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.551414Z","title":"Neural collapse with unconstrained features","venue":null,"work_id":"74db6181-26de-4949-8dcd-b87965d653a7","year":2022},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.001012Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:8781b055834dc1ee0fd757ba554d31e4dbdd9396dc3d4bf34da580bf03e9172e","observation_id":"65cf08cb-4b81-423b-9bfe-765f73129ae8","resolution":{"observed_at":"2026-08-07T14:29:35.585539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-07-31T05:05:41.080329Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T14:29:32.198096Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive.arXiv preprint arXiv:2402.13228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.198096Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:68b7e982f434836b444551b1756ad71a6522f7aeabbc84de24db535df2c80dbf","observation_id":"cc9af7d2-8533-41df-8f1b-6f9a67183a9e","resolution":{"observed_at":"2026-08-07T14:29:32.198096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:32.334464Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.334464Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:247a10bbf95182be4ba08f549c3d14b7af6d0fbe8adc6b8cb0b73833e755bc9e","observation_id":"fd6b3d69-c9a3-4268-8dc1-340694b26bfb","resolution":{"observed_at":"2026-08-07T14:29:32.334464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-07T14:29:32.444781Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization.arXiv preprint arXiv:2410.08847, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.444781Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:858abac3f817d94687e0e3b6b4099ffefb590cbb1779c64f9a169c68635fbd42","observation_id":"d3f472fa-05a6-4984-b680-13d8fa5b52de","resolution":{"observed_at":"2026-08-07T14:29:32.444781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10490","last_updated":"2025-06-29T05:43:22Z","snapshot_observed_at":"2026-08-01T14:47:14.023229Z","submitted_at":"2024-07-15T07:30:28Z","title":"Learning Dynamics of LLM Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10490","snapshot_observed_at":"2026-08-07T14:29:32.572317Z","title":"Learning dynamics of llm finetuning.arXiv preprint arXiv:2407.10490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.572317Z"},"links":{"cited_paper":"/paper/2407.10490","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:f09ace80d43da3ef59fb57483e5dfb371e2eca739054a5e65bc8cd6a2c8026de","observation_id":"cb0aa861-d8ce-4d6a-9d29-a536550589d8","resolution":{"observed_at":"2026-08-07T14:29:32.572317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:29:32.710722Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.710722Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:8dad55a161443eb9ea453fdb633d0b81f4d237dc0faf03b906f1c3e61de8257f","observation_id":"41608882-f242-4ed3-8191-4bc586c69a70","resolution":{"observed_at":"2026-08-07T14:29:32.710722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:29:32.815490Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.815490Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:ae5935bd8d343fbd3886807ca5b9e3d73774b9c7f28190f99f922e1f5165e85e","observation_id":"726ede61-1ee1-403e-9235-575fa2c83438","resolution":{"observed_at":"2026-08-07T14:29:32.815490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:29:32.921726Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.921726Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:3e07ddeb5625be8b1adcf00e33558203f3707a1e3253e571f3858aa03b8845aa","observation_id":"01b333f3-1f0b-4378-a7d7-4d48e3286691","resolution":{"observed_at":"2026-08-07T14:29:32.921726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.395538Z","title":"Aime problem set 1983-2024, 2023","venue":null,"work_id":"09f35c40-84eb-4e8a-a5ed-c5128ddbdcc6","year":1983},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.000764Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:7f550d2f406fa671c57b8729ad513a9bcf6c7293aa8533a4eb8dbb36f9eb1ae7","observation_id":"96dff3bd-5d64-4f4f-ae3c-5372b0de278a","resolution":{"observed_at":"2026-08-07T14:29:35.509164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:29:33.073364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.073364Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:1b0bed87f3d8b0e2f1af1f88229a5643e49417b8f400d4c96af1ac0bf2807d38","observation_id":"21575429-1287-40a5-b8cd-f7afa7856141","resolution":{"observed_at":"2026-08-07T14:29:33.073364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:29:33.120361Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.120361Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:437cde8bd207e59239ba600a47fe85cccaafdde5272723d29942e355ab416f42","observation_id":"a15f090f-5325-4091-b01e-7fe9210c3d57","resolution":{"observed_at":"2026-08-07T14:29:33.120361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03953","last_updated":"2018-03-02T20:20:52Z","snapshot_observed_at":"2026-08-04T06:22:23.897655Z","submitted_at":"2017-11-10T18:29:00Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03953","snapshot_observed_at":"2026-08-07T14:29:33.191566Z","title":"Breaking the softmax bottleneck: A high-rank rnn language model.arXiv preprint arXiv:1711.03953, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.191566Z"},"links":{"cited_paper":"/paper/1711.03953","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:039cf2973fd5d4cda34a5f0619e4b508108e3e30d61c229740abf986f04eaf61","observation_id":"bd1349c0-d83a-4598-8710-ddbb685d6d35","resolution":{"observed_at":"2026-08-07T14:29:33.191566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T14:29:33.267870Z","title":"Metamath: Bootstrap your own mathematical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.267870Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:d65a51c39e001a932ce120816470e1bdedc7ce182224f75afbc0db022f242c5c","observation_id":"86e8509a-9d1f-4541-8271-238cb2c324a4","resolution":{"observed_at":"2026-08-07T14:29:33.267870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:29:33.323315Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.323315Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:f97b3b03abb028fc0b4c1fe1bce569379f9578ba8e39570e636d4fb5ebb41372","observation_id":"1e7a4dd1-a25f-4783-b71d-bac8905ba860","resolution":{"observed_at":"2026-08-07T14:29:33.323315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-07T14:29:33.431718Z","title":"Advancing llm reasoning generalists with preference trees.arXiv preprint arXiv:2404.02078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.431718Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:f446f771dd2f44fd8e9c1690f46abd70c4e9ed50d28ddaa018adddb7af26e6dd","observation_id":"5bab72b9-5519-4cfb-8f12-b78c64860908","resolution":{"observed_at":"2026-08-07T14:29:33.431718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:29:33.492988Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.492988Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:bc5595c6eddddd8db480fd29b15fed6a04a46fd2c396926fe538a66813e5a358","observation_id":"b04807af-9df9-4bc3-b30c-5558edf2ef4f","resolution":{"observed_at":"2026-08-07T14:29:33.492988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15417","last_updated":"2025-02-19T02:31:46Z","snapshot_observed_at":"2026-07-06T19:06:50.144092Z","submitted_at":"2024-08-27T21:46:47Z","title":"Implicit Geometry of Next-token Prediction: From Language Sparsity Patterns to Model Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15417","snapshot_observed_at":"2026-08-07T14:29:33.608339Z","title":"Implicit geometry of next-token prediction: From language sparsity patterns to model representations.arXiv preprint arXiv:2408.15417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.608339Z"},"links":{"cited_paper":"/paper/2408.15417","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:98e59b34811a0a2e2cba05cf7819d5229851a1db3b72db1f6208eb7e4fc8084e","observation_id":"4177ec77-2d36-4819-af22-815479f91d08","resolution":{"observed_at":"2026-08-07T14:29:33.608339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.232657Z","title":"one commercially available ten-button lock may be opened by pressing – in any order – the correct five buttons","venue":null,"work_id":"5513be8f-6d2d-4faf-8724-fe5a9cecbedf","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.696512Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:adfe0080a4bf5df39861353c917ac6eecac0562e755d0e2b21009bcfc4205091","observation_id":"93de0474-6ead-4896-9f95-87061801dad4","resolution":{"observed_at":"2026-08-07T14:29:35.313069Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.014612Z","title":"From the given graph, we can observe the following: - The roots off(x)are atx= 1 andx= 3","venue":null,"work_id":"5e3e6008-cd40-4a74-95ce-c12ebb2bdffd","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.803416Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:a9cdbf40147e84faa8e157de5cfe20a4a5ad7631dfa13c7820308d1f9b35c692","observation_id":"37e0f6f9-5bc9-40c9-95f9-8c882721387e","resolution":{"observed_at":"2026-08-07T14:29:35.094259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.918851Z","title":"Therefore: - The roots of g(x)are also atx= 1 andx= 3","venue":null,"work_id":"db3ef681-d486-4940-a407-d24ef18184b5","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.875782Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:459978b78cc0bc5b1aa1ed7881b174b3b0d9cb5874dcabfc2aa6f315c5491ea7","observation_id":"1ad0abfb-49ad-4c55-80ac-4b4a33f33c88","resolution":{"observed_at":"2026-08-07T14:29:34.956361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.821703Z","title":"This simplifies to: f(x) = 0 The roots off(x)are atx= 1 andx= 3","venue":null,"work_id":"1e1f24c9-2200-442c-9a46-73c2c264cf30","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.935421Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:d1c818442849e9ad342c6408712b7c42399f555fe7891c1c655056e47f2eb806","observation_id":"7ba4801a-f4b9-485c-8328-5cb5b74f5928","resolution":{"observed_at":"2026-08-07T14:29:34.870775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.665427Z","title":"This implies thatf(x)is an even function, and its graph is symmetric about the y-axis","venue":null,"work_id":"180e1769-dcc9-4d73-b573-0cddbdb4b782","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:34.013794Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:76760cd3019381347a296b44ac4c8d0d1e527b2dc08cb97b2813f4189146c117","observation_id":"d34fc82a-47eb-4b63-883c-158d98591680","resolution":{"observed_at":"2026-08-07T14:29:34.738641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:22:40.658601Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2505.18830."}