{"as_of":"2026-08-15T16:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42a7790badbf43e1a6e8e4b39f685b6bace7329438cf5d01cc6366fba77b71b8","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T05:31:55.864438Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":75,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:41:36.440654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T12:30:58.223702Z","title":"arXiv preprint arXiv:2601.05242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01557","last_updated":"2026-05-24T17:24:39Z","snapshot_observed_at":"2026-08-10T04:55:17.495067Z","submitted_at":"2025-09-01T15:36:17Z","title":"Real-Time Hardware-Free HIFU Interference Suppression via Teacher-Student Diffusion Framework","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T12:30:58.223702Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2509.01557"},"observation_digest":"sha256:987009ca6fc729df968af2093bb7cbb77fd15dffba0fbe4567f42d50ad6a8aea","observation_id":"756b415a-fac6-475c-a928-5c0b93d09dbc","resolution":{"observed_at":"2026-08-05T12:30:58.223702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2511.00066","last_updated":"2026-05-13T07:57:37Z","snapshot_observed_at":"2026-08-06T07:33:01.385285Z","submitted_at":"2025-10-29T08:07:47Z","title":"Sharpness-Guided Group Relative Policy Optimization via Probability Shaping","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T03:10:57.839146Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2511.00066"},"observation_digest":"sha256:5b640cbc7a4f4fc2c2ce739d5b264e9e5cde62ae9967c3c21724a35fcd453555","observation_id":"5ae3d4ec-5dae-4916-b904-92d217142dcb","resolution":{"observed_at":"2026-05-18T03:12:22.352863Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2601.21861","last_updated":"2026-04-07T10:17:12Z","snapshot_observed_at":"2026-08-13T08:38:32.660347Z","submitted_at":"2026-01-29T15:31:04Z","title":"Spatiotemporal Continual Learning for Mobile Edge UAV Networks: Mitigating Catastrophic Forgetting","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:25.954499Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2601.21861"},"observation_digest":"sha256:802551247ade2211a4d65ea71a0d51b587f019d0d6fa684e6413ee05b47f8aae","observation_id":"b765e8bd-e92c-4454-a086-c2147b294638","resolution":{"observed_at":"2026-05-16T09:40:48.910497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T15:41:36.440654Z","title":"Liu, S.-Y ., Dong, X., Lu, X., Diao, S., Belcak, P., Liu, M., Chen, M.-H., Yin, H., Wang, Y .-C","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.22448","last_updated":"2026-07-09T02:23:00Z","snapshot_observed_at":"2026-08-15T15:35:20.601529Z","submitted_at":"2026-01-30T01:31:17Z","title":"HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:41:36.440654Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2601.22448"},"observation_digest":"sha256:e90a878f3e4ea4e007e738e022ed2c419d60a13ca20bb48828485c1bafb2e84e","observation_id":"54068fc5-9baa-4763-ae28-8dc667633fcd","resolution":{"observed_at":"2026-08-15T15:41:36.440654Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-03T04:17:27.504798Z","title":"Gdpo: Group reward-decoupled normalization policy optimization for multi-reward rl optimization.arXiv preprint arXiv:2601.05242, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-08T23:12:50.234380Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.504798Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:c02ed05a4780afae1384f39da6a1d606f5b1dd52ad90187a10031f2490902430","observation_id":"e380dba4-12c8-41f6-94d7-c2c62ee88766","resolution":{"observed_at":"2026-08-03T04:17:27.504798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-02T19:10:40.676299Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.03536","last_updated":"2026-07-27T02:42:05Z","snapshot_observed_at":"2026-08-08T00:59:17.102915Z","submitted_at":"2026-03-03T21:46:53Z","title":"SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T19:10:40.676299Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2603.03536"},"observation_digest":"sha256:54759d26dfad5984b0a77f12f7bee774e6970f610c1480cb0d708d7552796bd5","observation_id":"2decc221-ac9f-49fc-b4dc-8aa7d8a64757","resolution":{"observed_at":"2026-08-02T19:10:40.676299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-03T02:34:59.197748Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.19585","last_updated":"2026-07-31T08:30:05Z","snapshot_observed_at":"2026-08-11T01:53:17.829269Z","submitted_at":"2026-03-20T02:57:50Z","title":"SaFRO: Satisfaction-Aware Fusion via Dual-Relative Policy Optimization for Short-Video Search","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:59.197748Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2603.19585"},"observation_digest":"sha256:d91194eb02f2c0c8f941bd7777d590d6722b656af27d14a1501576b5e3745448","observation_id":"6ae12815-035b-41c9-8bc9-ecd39067c914","resolution":{"observed_at":"2026-08-03T02:34:59.197748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-07-13T16:50:50.552104Z","title":"arXiv preprint arXiv:2601.05242 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.27742","last_updated":"2026-07-08T11:45:48Z","snapshot_observed_at":"2026-08-15T10:27:50.333664Z","submitted_at":"2026-03-29T15:50:36Z","title":"TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:50.552104Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2603.27742"},"observation_digest":"sha256:5b0e0a67e978ca4751818d68c25cd1be94dfe39a52de7d10b898f24fa2a1087f","observation_id":"6ab570eb-3ded-4986-8413-b22c95dddac7","resolution":{"observed_at":"2026-07-13T16:50:50.552104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-07-13T12:58:58.057084Z","title":"Gdpo: Group reward-decoupled normalization policy optimization for multi-reward rl optimization.arXivpreprintarXiv:2601.05242, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.03581","last_updated":"2026-04-04T04:12:47Z","snapshot_observed_at":"2026-08-14T22:15:50.205121Z","submitted_at":"2026-04-04T04:12:47Z","title":"HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T12:58:58.057084Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.03581"},"observation_digest":"sha256:4d75464fd8b9fbd354488edba6de1fb86229b95db21d800cf04af9986d53e4e2","observation_id":"cad6fa33-eb62-42db-ae54-8afd890265f4","resolution":{"observed_at":"2026-07-13T12:58:58.057084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2604.06159","last_updated":"2026-04-07T17:55:59Z","snapshot_observed_at":"2026-08-14T16:50:00.084741Z","submitted_at":"2026-04-07T17:55:59Z","title":"Target Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:21:37.744591Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.06159"},"observation_digest":"sha256:ead5d03e3d90b12b8d199e5c5fde3c36235e79217db7d385b032ef85883c825a","observation_id":"31c6e195-efff-4d38-8380-3ebe6d7ef01d","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-08-12T14:20:57.728113Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:207432b922c8ffb41bb12249f21d1472099228f1103d27c9413ac9f12e930918","observation_id":"91013a7c-3150-4123-b73f-20a5cc6ad4ec","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2604.18187","last_updated":"2026-04-20T12:43:00Z","snapshot_observed_at":"2026-08-11T15:09:49.950495Z","submitted_at":"2026-04-20T12:43:00Z","title":"Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T03:41:27.425176Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.18187"},"observation_digest":"sha256:1b15c2593c360cc1c243d9ed7d20cc5eac428d3b84b1621694570d87bbbb35d4","observation_id":"419c69a7-8e32-4422-a630-cdcfce22a5d6","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2604.19355","last_updated":"2026-05-27T09:37:48Z","snapshot_observed_at":"2026-08-11T14:54:56.695553Z","submitted_at":"2026-04-21T11:36:09Z","title":"LASER: Learning Active Sensing for Continuum Field Reconstruction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T03:35:23.240677Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.19355"},"observation_digest":"sha256:29bd1cb8a2f7f9e248c4bf0786fc7e676815754f1030903c11f1b7b82d53b328","observation_id":"6d3afc50-cc49-44d5-8f5c-60079f14a76b","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2604.19355","last_updated":"2026-05-27T09:37:48Z","snapshot_observed_at":"2026-08-11T14:54:56.695553Z","submitted_at":"2026-04-21T11:36:09Z","title":"LASER: Learning Active Sensing for Continuum Field Reconstruction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T08:29:56.797997Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.19355"},"observation_digest":"sha256:619a43718a02d221130b46ca436aa46a7c11a4ea86b35966a3691c5e6fe425bd","observation_id":"0e7e998a-d4b1-4d97-904a-c8028c083c3b","resolution":{"observed_at":"2026-07-05T08:30:53.002288Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2604.22840","last_updated":"2026-04-21T11:59:03Z","snapshot_observed_at":"2026-08-15T12:55:42.890760Z","submitted_at":"2026-04-21T11:59:03Z","title":"AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:18:05.770211Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2604.22840"},"observation_digest":"sha256:dfabdb59f3382cb10860b79ec6471ba1c0f39a58bdcbce7f20437b12957fcf24","observation_id":"a73cf345-a0b9-4e67-b8c3-fe8e89420450","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.00015","last_updated":"2026-07-31T03:07:58Z","snapshot_observed_at":"2026-08-05T23:10:40.138310Z","submitted_at":"2026-04-18T06:22:26Z","title":"TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:28.648869Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.00015"},"observation_digest":"sha256:2856bae5c2288b821316f26cca33b984e2e210eaaf2192a1a0e6725ef832c1b9","observation_id":"1c290574-c2b5-4415-823e-fc33590f1616","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-03T02:26:14.136231Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.00015","last_updated":"2026-07-31T03:07:58Z","snapshot_observed_at":"2026-08-05T23:10:40.138310Z","submitted_at":"2026-04-18T06:22:26Z","title":"TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T02:26:14.136231Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.00015"},"observation_digest":"sha256:5585b0290b1be6bea918798644dbb674b7d92801c5da7fa061acd1a13ac21e99","observation_id":"a0df11c5-c6e9-48c4-98c3-9f707f9547c9","resolution":{"observed_at":"2026-08-03T02:26:14.136231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:d602c463635c37141599af453a75f4cacf0a232b616ae4cfe6dee637f92c7fd7","observation_id":"ecf9a142-5195-43a7-a4b7-01ca095de9e6","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:c02af9a8328a033ab411e5c1a2c9027f485edb6c2002680818506f0716840987","observation_id":"9fd3a95b-8c5f-49cf-ada2-17da193727e2","resolution":{"observed_at":"2026-05-21T08:19:52.648398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.04499","last_updated":"2026-05-06T05:02:40Z","snapshot_observed_at":"2026-08-14T07:31:43.673591Z","submitted_at":"2026-05-06T05:02:40Z","title":"Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:48:09.078064Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.04499"},"observation_digest":"sha256:fe01807c772a1953c8c68b8863ba553a99dc6a8e757301e0bced948c3899e7f8","observation_id":"a42b4f71-db54-4435-bbf6-d31c03f57ee6","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.05750","last_updated":"2026-05-07T06:43:05Z","snapshot_observed_at":"2026-08-11T17:11:40.449537Z","submitted_at":"2026-05-07T06:43:05Z","title":"RVPO: Risk-Sensitive Alignment via Variance Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T15:00:11.237293Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.05750"},"observation_digest":"sha256:665c7e304af2d799a0490a0f445d89443262cdf743126b97136913f74a8c7f82","observation_id":"e828cad4-e01a-4dd7-871a-04f5f38d6f66","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-08-14T12:03:03.107855Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:38b4a26c3c8887bb95b5587dc453aa28acbaafdbcecd9cb3bac6ec65ac9a4502","observation_id":"314fdb32-8343-4a63-9f61-48325ea1d40e","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-09T17:46:54.267669Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:f3c8a265949ecade903da7106736aa90d95a5a3e8a8e8007e25911e0caa0c1c2","observation_id":"c3a0b8f1-76a3-4943-8dda-e27bc9f73d8d","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.07276","last_updated":"2026-05-08T05:41:25Z","snapshot_observed_at":"2026-08-14T19:57:40.700811Z","submitted_at":"2026-05-08T05:41:25Z","title":"Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:21:43.166304Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.07276"},"observation_digest":"sha256:b23d9dc99adcb8f82ff5176f3f6a82cc4fcc986f67e818b8fcf7781b8f68cbb4","observation_id":"dec8714c-c459-440e-af63-b17846014260","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.07394","last_updated":"2026-05-08T07:48:36Z","snapshot_observed_at":"2026-08-15T09:45:13.527605Z","submitted_at":"2026-05-08T07:48:36Z","title":"BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-11T01:52:27.764121Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.07394"},"observation_digest":"sha256:5f3a1ca7885fe9954ad20e60b1ac670782ae44d25faabb1ac84e363d96e00cbf","observation_id":"b86a72f0-c157-48e4-b015-4bf978b8cf12","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.09806","last_updated":"2026-05-10T23:05:02Z","snapshot_observed_at":"2026-08-11T14:51:56.510873Z","submitted_at":"2026-05-10T23:05:02Z","title":"LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:42.407934Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.09806"},"observation_digest":"sha256:2f57d0c8f51aede6f93bdc92a5223ea0e7173f20c98ea332288650db404be6a5","observation_id":"579ec141-6ada-49da-ac25-7be3f7e63d2f","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.10268","last_updated":"2026-05-11T09:30:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T09:30:59Z","title":"MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T05:22:43.330891Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.10268"},"observation_digest":"sha256:7c6ea840a9e405e38d45e852cf82a65e66f4b72198221790d21bbbace3722e35","observation_id":"afd2f9c9-da37-4372-ab6b-b9f41bd8a7ce","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-12T16:10:37.480335Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:640e94b9c90a99930d8bd4246c5cc9214eded898a8f476ae7a29b60059835474","observation_id":"a8795d1d-3643-44ca-b74a-161beaf87c63","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.13534","last_updated":"2026-05-13T13:46:35Z","snapshot_observed_at":"2026-08-11T01:15:24.259437Z","submitted_at":"2026-05-13T13:46:35Z","title":"Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T18:52:42.989888Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.13534"},"observation_digest":"sha256:d723d5ee0930cc73e991e990753c6dbf1292ad26c8308a1f22cdec882cd2168b","observation_id":"2532e26e-3f01-4db6-909d-58dce24a829a","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.13641","last_updated":"2026-05-13T15:05:18Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:05:18Z","title":"Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T19:24:05.375951Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.13641"},"observation_digest":"sha256:29417f3d934c4c42b4bb24a6c614f61baa3951e2e0b9482059dd6e0208ff5661","observation_id":"7649c6d4-b12b-4472-934c-3e8720022b87","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-11T00:27:38.038120Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:5582f39cbd22600298cb93943e7198c04e6f9e7a07fdeae6f80143e8ff1d68f2","observation_id":"1f25d252-ab46-4924-a118-18dae3533de2","resolution":{"observed_at":"2026-05-15T05:31:56.190613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.18899","last_updated":"2026-05-17T11:10:44Z","snapshot_observed_at":"2026-08-15T05:38:09.029712Z","submitted_at":"2026-05-17T11:10:44Z","title":"Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T14:13:49.666793Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.18899"},"observation_digest":"sha256:ec0e246e65c8da280cf1ce3b9da51ac90cbd5d2f50f5bd803445318b1b00a5cf","observation_id":"332a722f-8f81-487c-af95-163ff3f03bbd","resolution":{"observed_at":"2026-05-20T14:18:21.446022Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:02:35.271960Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.20164"},"observation_digest":"sha256:e5200797905c4663476e4ea39953f499d9ad1de6e23d8413e058e0fb34415e75","observation_id":"8410e56d-cc67-4eb0-a5a7-d1f1bbebb74f","resolution":{"observed_at":"2026-05-20T05:03:03.550716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-15T07:14:01.028636Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:b288fc4d0baa39774f6ecd5794f0eac58f16a470c513ffcfa6f77b2708a42f3e","observation_id":"fd05c426-13db-4602-8a4c-27135cbc2e9f","resolution":{"observed_at":"2026-05-21T06:19:41.937876Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.23281","last_updated":"2026-05-22T06:47:19Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T06:47:19Z","title":"DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T04:29:16.600159Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.23281"},"observation_digest":"sha256:e7e221c1b2aa92c15899bd50e7bb6b9581aaf1b42a12c1c75cf535221a13bebc","observation_id":"eb2202f9-567a-4391-9d3d-71bbc11e88df","resolution":{"observed_at":"2026-05-25T04:30:19.865498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.25443","last_updated":"2026-05-25T05:42:57Z","snapshot_observed_at":"2026-08-15T03:37:29.803795Z","submitted_at":"2026-05-25T05:42:57Z","title":"Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:18:10.508034Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.25443"},"observation_digest":"sha256:bf650cc49b1e416607827917640f879bc59bd6b8c4abccbdfa000477c5881c06","observation_id":"aa991f04-88ca-42f9-ad4f-2b0934d6c9e5","resolution":{"observed_at":"2026-06-29T22:24:00.427611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2605.25511","last_updated":"2026-05-25T07:15:38Z","snapshot_observed_at":"2026-08-14T13:51:46.295286Z","submitted_at":"2026-05-25T07:15:38Z","title":"CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:04.277333Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2605.25511"},"observation_digest":"sha256:ba8af899b0c7d370cbcf101356aa264910d88cb5ac5d4619ceb0031515b65d97","observation_id":"9a425fd3-0c6f-422f-8a3e-f3c3e99c8355","resolution":{"observed_at":"2026-06-29T21:53:59.318824Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.00204","last_updated":"2026-05-29T17:59:31Z","snapshot_observed_at":"2026-08-10T22:04:11.187534Z","submitted_at":"2026-05-29T17:59:31Z","title":"APE: Agentic Prompt Enhancer for Image Generation and Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T22:58:17.807988Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.00204"},"observation_digest":"sha256:86d5982e037adc0c6ce295d14c86e55bcb53c6575ab438089466ad98d28ca93a","observation_id":"d750f5b7-4775-485f-8675-09b1042e36e7","resolution":{"observed_at":"2026-06-28T23:02:46.693518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-12T22:34:53.432641Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:91c483e6c3eb2eed7628b17f81a4ee595b2e0d57edb6fd2eff9ccb7b4ceac6bf","observation_id":"c430fc96-1c4a-42ce-980c-145aa79a3982","resolution":{"observed_at":"2026-06-28T19:02:34.057899Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.07412","last_updated":"2026-06-05T16:00:17Z","snapshot_observed_at":"2026-08-12T04:16:57.514743Z","submitted_at":"2026-06-05T16:00:17Z","title":"Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:16:14.267471Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.07412"},"observation_digest":"sha256:d97b5394e794fcc06bcb699f1735cf51a9bc3f6c78f28927b0c0621462b1d817","observation_id":"4c25ea9a-6e08-40ba-a01c-ad13555f3673","resolution":{"observed_at":"2026-07-02T19:47:19.966898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:c2316567987bc9644fc422b283fd7eea3ffb592f33bdefdf3b7f152734f593b5","observation_id":"acf14a0f-0a73-4baa-aec8-9768f1748718","resolution":{"observed_at":"2026-07-02T21:07:23.875133Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.10931","last_updated":"2026-07-17T04:23:35Z","snapshot_observed_at":"2026-08-12T12:46:07.918657Z","submitted_at":"2026-06-09T14:44:01Z","title":"It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T13:18:38.450423Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.10931"},"observation_digest":"sha256:5b6ffdcc4843b203f565b1cc1b7d9fb7663e5b4499fecfe4c348a65be21455e2","observation_id":"d2e61737-9652-43b1-a6b3-f07670e7865f","resolution":{"observed_at":"2026-07-03T05:27:39.778455Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-02T11:54:45.594653Z","title":"Tongliang Liu and Dacheng Tao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10931","last_updated":"2026-07-17T04:23:35Z","snapshot_observed_at":"2026-08-12T12:46:07.918657Z","submitted_at":"2026-06-09T14:44:01Z","title":"It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T11:54:45.594653Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.10931"},"observation_digest":"sha256:93e7fcf688bddd3a0eeaec26a03ee618109a4d12a93ee8ebd2a4851b68949cea","observation_id":"ee104ebc-bcec-4998-a31f-4cc87155e90e","resolution":{"observed_at":"2026-08-02T11:54:45.594653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.11025","last_updated":"2026-06-27T07:44:26Z","snapshot_observed_at":"2026-08-15T05:25:38.968321Z","submitted_at":"2026-06-09T15:59:57Z","title":"Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T14:20:02.171646Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.11025"},"observation_digest":"sha256:c42d5ea53b5a8af15de4a7188a42f7baa11c542e84c9bb1249f205afd1da794b","observation_id":"776c23a1-4bd0-4ab8-8a5f-c5953a6d375d","resolution":{"observed_at":"2026-07-03T03:57:38.713059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.11025","last_updated":"2026-06-27T07:44:26Z","snapshot_observed_at":"2026-08-15T05:25:38.968321Z","submitted_at":"2026-06-09T15:59:57Z","title":"Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T10:52:23.199230Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.11025"},"observation_digest":"sha256:be17af8cd3e29c49fac2fe816d916b7ea123532c46ade2c5286ef243b0a27cf0","observation_id":"43be9fb9-a16a-4356-afee-f3671210174d","resolution":{"observed_at":"2026-06-30T10:54:36.275829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:91c540dcccc8902c7966367071315ef3548d3ea61faace6fb23ab83084d3ffdb","observation_id":"063e3d13-47bb-489c-9bf6-cfbafbad0576","resolution":{"observed_at":"2026-06-27T13:20:57.362956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.17362","last_updated":"2026-06-15T23:39:36Z","snapshot_observed_at":"2026-08-13T00:03:13.014773Z","submitted_at":"2026-06-15T23:39:36Z","title":"DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T03:04:13.554098Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.17362"},"observation_digest":"sha256:d7408e215840802f5c9b292f4579de6d5816a8e1ca95a389ad1fa32983d9831b","observation_id":"ad7b8ad7-8902-4870-9053-e2d5accc0660","resolution":{"observed_at":"2026-07-03T18:28:48.894727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:5e8f77994b9b8ee822a3702ee0fee68860633236641003afb6bd62d48aed9cbc","observation_id":"0aa6f82d-6ef2-4736-9625-bb22cdbf692e","resolution":{"observed_at":"2026-07-03T20:48:56.134917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.19103","last_updated":"2026-06-17T14:16:47Z","snapshot_observed_at":"2026-08-08T06:10:02.208503Z","submitted_at":"2026-06-17T14:16:47Z","title":"ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T21:17:04.368521Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.19103"},"observation_digest":"sha256:063e4beb9deae3dc5e8a9ce334fa52485750a629fe8d6e5caa5f6b94efbacf60","observation_id":"b381c90d-44ed-4f2d-874d-647402c74b37","resolution":{"observed_at":"2026-07-04T00:19:13.532151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.21447","last_updated":"2026-07-02T15:35:00Z","snapshot_observed_at":"2026-08-02T12:36:31.655441Z","submitted_at":"2026-06-19T14:07:12Z","title":"Precision Recall Controllable Radiology Report Generation via Hybrid Natural Language and Clinical Reward Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:24:49.321248Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.21447"},"observation_digest":"sha256:30a00ec25f823a7c0c61cf4b6711e2230cd920234639ebaa854d5601cb8c6290","observation_id":"5e87097d-e921-4943-94b8-b5255ecbeeea","resolution":{"observed_at":"2026-07-04T06:29:37.817747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.21447","last_updated":"2026-07-02T15:35:00Z","snapshot_observed_at":"2026-08-02T12:36:31.655441Z","submitted_at":"2026-06-19T14:07:12Z","title":"Precision Recall Controllable Radiology Report Generation via Hybrid Natural Language and Clinical Reward Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-03T23:16:52.446951Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.21447"},"observation_digest":"sha256:fa0e22911a79ef43b2dc7808db746bcb87bb40b8c80d6997d10eb6f49ef74f53","observation_id":"0bbf67cd-b306-4aec-8879-54cb24cae39b","resolution":{"observed_at":"2026-07-03T23:19:02.328520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:ec0c30a9718049e9daa35d7b110bf26f26c0bbff86eaff0bcfb7950bb3ed2c9f","observation_id":"86d15dec-f82c-43a5-9b4d-b8afaf7f053c","resolution":{"observed_at":"2026-07-04T08:09:40.651987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.25496","last_updated":"2026-06-24T07:23:20Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T07:23:20Z","title":"Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T20:21:09.611166Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.25496"},"observation_digest":"sha256:a2f9828673e61c58666b38b092bdf8b4d055b8500a00ba620610dcb92fbdd2d5","observation_id":"c6844963-29d2-4bb7-b6cb-c8d0b251f8e9","resolution":{"observed_at":"2026-07-04T20:20:07.231762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.26947","last_updated":"2026-06-25T12:21:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-25T12:21:13Z","title":"Scaling Multi-Reference Image Generation with Dynamic Reward Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T05:06:12.721122Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.26947"},"observation_digest":"sha256:0827901fe3667eaaf61b082eb7dd21b5f2f5ac566aaeec6247dbe1479649ab36","observation_id":"50c3f134-735c-4433-a934-a630ec25c35a","resolution":{"observed_at":"2026-07-04T13:39:50.262046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.27608","last_updated":"2026-06-25T23:49:50Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-25T23:49:50Z","title":"Qwen-Image-2.0-RL Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T01:11:12.757656Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.27608"},"observation_digest":"sha256:546e0f9d722e2d41431ef5b64b6715812922a0bfccdb826856a19861d9595657","observation_id":"b4df026d-1a6d-4169-b402-ea447b561c76","resolution":{"observed_at":"2026-07-01T19:06:02.841539Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.31575","last_updated":"2026-06-30T12:33:19Z","snapshot_observed_at":"2026-08-15T13:50:03.112722Z","submitted_at":"2026-06-30T12:33:19Z","title":"Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T05:27:22.527220Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.31575"},"observation_digest":"sha256:34d41b882f7580c09a7b3c1294d4822912dccf253d3db0c31c6d0979dc2858dc","observation_id":"22060474-f3aa-4c8a-af79-5bb78a40b770","resolution":{"observed_at":"2026-07-01T10:25:42.399885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.31711","last_updated":"2026-06-30T14:17:05Z","snapshot_observed_at":"2026-08-14T17:19:56.615623Z","submitted_at":"2026-06-30T14:17:05Z","title":"Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T05:15:40.555929Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.31711"},"observation_digest":"sha256:0c2561c554be7d9dd45b634e0187eb6d01bfa8eda4ace4b03e4a368e8a14adcf","observation_id":"c8456204-8654-4122-b66c-c2548f31fcae","resolution":{"observed_at":"2026-07-01T10:45:42.054069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.01191","last_updated":"2026-07-01T17:24:26Z","snapshot_observed_at":"2026-08-02T15:51:49.700376Z","submitted_at":"2026-07-01T17:24:26Z","title":"Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-02T13:24:17.538850Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.01191"},"observation_digest":"sha256:cb88e6ec6f6f3979ad8c5639a2d04243bbc84739bab9f4bf2cce2c44a5bd1352","observation_id":"03ca1633-f4ab-4994-81b7-0608bac1dbe4","resolution":{"observed_at":"2026-07-02T13:26:58.475026Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.01470","last_updated":"2026-07-01T21:02:54Z","snapshot_observed_at":"2026-08-08T20:27:06.982091Z","submitted_at":"2026-07-01T21:02:54Z","title":"World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-03T20:14:46.147637Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.01470"},"observation_digest":"sha256:c7dff048cac3a14ebd289626aabb8c9e98f4c13b1c39a744145982e25b89b316","observation_id":"c52bfc50-600d-4071-9ee1-3ce319ec6ee1","resolution":{"observed_at":"2026-07-03T20:18:55.849272Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.01927","last_updated":"2026-07-02T09:22:36Z","snapshot_observed_at":"2026-08-13T14:19:46.006390Z","submitted_at":"2026-07-02T09:22:36Z","title":"TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T15:09:14.993998Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.01927"},"observation_digest":"sha256:6e9e36cde5c39b61c19e9f10c28234ee3943ac60f0d750930dc16183ddd00b9a","observation_id":"067ffb3f-8381-4700-9906-be33b54cbd13","resolution":{"observed_at":"2026-07-03T15:18:32.915329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.06522","last_updated":"2026-07-07T17:27:59Z","snapshot_observed_at":"2026-08-15T08:05:47.608523Z","submitted_at":"2026-07-07T17:27:59Z","title":"Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T03:13:07.963343Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.06522"},"observation_digest":"sha256:863948046ae3409a85df04e41a489792d35f47187521474866d4047176b441ac","observation_id":"9e5e5603-4bdb-422c-b1c4-72f21a964894","resolution":{"observed_at":"2026-07-08T03:14:31.674801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-15T02:36:31.464639Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:db9d34c368b80b0b153d91b1f9955aba51b58bf6dce5c0c42af497cf28f23e62","observation_id":"11334e03-e355-4ae6-924e-e86d06c2c4c8","resolution":{"observed_at":"2026-07-09T03:05:55.271067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T14:37:32.540554Z","title":"GDPO: Group reward-decoupled normalization policy optimization for multi-reward RL optimization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.540554Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:d56cf70c48d4922a39a9d3340254bad50b4b23eab80f2d5e0d925acfa75edb51","observation_id":"b8049c65-21f1-4c5a-878c-252c59991c2f","resolution":{"observed_at":"2026-08-01T14:37:32.540554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T08:01:22.671613Z","title":"GDPO: Group reward-decoupled normalization policy optimization for multi- reward RL optimization.arXiv preprint arXiv:2601.05242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21273","last_updated":"2026-08-04T10:37:25Z","snapshot_observed_at":"2026-08-07T23:11:42.684740Z","submitted_at":"2026-07-23T12:50:18Z","title":"The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:01:22.671613Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.21273"},"observation_digest":"sha256:081f56f5b6d273ceb8f479e4245c66b535af122ddc8b40cd0bf9ad03d6b27567","observation_id":"f9e26078-28c1-476d-81af-d8a08b4a3e21","resolution":{"observed_at":"2026-08-01T08:01:22.671613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T07:28:17.804777Z","title":"arXiv preprint arXiv:2601.05242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-14T09:58:33.194671Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:17.804777Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:467452b9c482a4d741305179e5a4c1d2da581870b47cc6f09feba4f4e20a80dd","observation_id":"9cf67799-577a-4114-afb6-2495a684fd25","resolution":{"observed_at":"2026-08-01T07:28:17.804777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T01:52:02.477551Z","title":"arXiv preprint arXiv:2601.05242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.477551Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:45ae37bb099b018e71cb56c6b2e2c90ec968b2bcfb964733a63e7f309d2205e2","observation_id":"4b357547-316a-48f5-a73c-4ec5b56ddc10","resolution":{"observed_at":"2026-08-01T01:52:02.477551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T14:11:20.934737Z","title":"Gdpo: Group reward- decoupled normalization policy optimization for multi-reward rl optimization.arXiv preprint arXiv:2601.05242, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26515","last_updated":"2026-07-29T06:28:26Z","snapshot_observed_at":"2026-08-06T07:53:46.025715Z","submitted_at":"2026-07-29T06:28:26Z","title":"HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:11:20.934737Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.26515"},"observation_digest":"sha256:b8a5c9cace1a233a411ffb034f06204809a27a3615a92dc9bde7083172be8904","observation_id":"e8b4066c-9a62-4e75-9310-a28ca5601676","resolution":{"observed_at":"2026-08-01T14:11:20.934737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-03T15:58:06.400280Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28987","last_updated":"2026-07-31T03:30:25Z","snapshot_observed_at":"2026-08-15T12:40:39.840187Z","submitted_at":"2026-07-31T03:30:25Z","title":"A Formalism-Aware Reward Loop for Handwritten UML-to-PlantUML Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:06.400280Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.28987"},"observation_digest":"sha256:053da3ded48671fb480ebbe02f7cb7a55da415f2fb21bcae0d729fef3dcdc53c","observation_id":"4465a515-2790-4087-a521-d354a93bb977","resolution":{"observed_at":"2026-08-03T15:58:06.400280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-03T10:57:57.281195Z","title":"Gdpo: Group reward-decoupled normalization policy optimization for multi-reward rl optimization, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.281195Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:4a0c953d862530bd7fca24886ea46922113fe02fdd9740c25e30c0f4107bfe7b","observation_id":"91e8983d-011f-4b77-9d09-18d24677f944","resolution":{"observed_at":"2026-08-03T10:57:57.281195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T14:57:53.701026Z","title":"2601.05242 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-15T14:50:33.214921Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.701026Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f07f9b42c8713e3262ff489ea3617aee0bba94cbd3048112ce1b9bd4637a662a","observation_id":"3bc3d340-d0ad-46f6-886e-05ad422f23b4","resolution":{"observed_at":"2026-08-15T14:57:53.701026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-10T21:04:21.686902Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06778","last_updated":"2026-08-07T03:52:33Z","snapshot_observed_at":"2026-08-15T07:49:05.897856Z","submitted_at":"2026-08-07T03:52:33Z","title":"Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T21:04:21.686902Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.06778"},"observation_digest":"sha256:398cc1f951f07856cdee3078f0d50d642c9308c67e59c96ae85651a309b55c7e","observation_id":"b293e87d-f5db-43d3-bbab-abb4f9fe0c65","resolution":{"observed_at":"2026-08-10T21:04:21.686902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-12T00:38:21.946354Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08009","last_updated":"2026-08-08T08:41:26Z","snapshot_observed_at":"2026-08-15T03:41:13.463408Z","submitted_at":"2026-08-08T08:41:26Z","title":"Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:38:21.946354Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.08009"},"observation_digest":"sha256:a141463386e4d68bd652b31e2971a79edce1858231748ed1161b915317c5c8b3","observation_id":"6883944a-b635-4ce0-836c-bbb1f219f393","resolution":{"observed_at":"2026-08-12T00:38:21.946354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T14:24:49.633399Z","title":"F.; Cheng, K.-T.; Choi, Y.; Kautz, J.; and Molchanov, P","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10513","last_updated":"2026-08-11T05:37:59Z","snapshot_observed_at":"2026-08-15T14:16:46.285120Z","submitted_at":"2026-08-11T05:37:59Z","title":"SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:24:49.633399Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.10513"},"observation_digest":"sha256:396bfa3d59a30506ddb3af47ccdb1ec36a359735b6b616870a475e03bef55513","observation_id":"8c6746d9-388b-4d77-992a-e3c437860635","resolution":{"observed_at":"2026-08-15T14:24:49.633399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-12T18:51:39.915223Z","title":"GDPO: Group reward- Decoupled Normalization Policy Optimization for Multi-reward RL Optimization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10714","last_updated":"2026-08-11T09:32:52Z","snapshot_observed_at":"2026-08-15T06:02:44.025354Z","submitted_at":"2026-08-11T09:32:52Z","title":"Conversational Orchestration for Organic 6G","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:39.915223Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.10714"},"observation_digest":"sha256:14bee1d1ac76345f9afc76c6f3b17ce2a2a89b32928e5ee2a9a7a707039f7daf","observation_id":"16f86c57-e7c9-4d71-9c00-ed02c5ebba99","resolution":{"observed_at":"2026-08-12T18:51:39.915223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-12T17:56:48.463595Z","title":"arXiv preprint arXiv:2601.05242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10764","last_updated":"2026-08-11T10:22:08Z","snapshot_observed_at":"2026-08-14T23:12:05.900289Z","submitted_at":"2026-08-11T10:22:08Z","title":"FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T17:56:48.463595Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.10764"},"observation_digest":"sha256:d5b1bd1c9a7a6fee3b029c6fb9f4408f5e039c5117f00fc2de102ebc27d347b6","observation_id":"7bd78f97-a4eb-41da-9db7-a23278644693","resolution":{"observed_at":"2026-08-12T17:56:48.463595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.05242/citation-record","integrity":"/paper/2601.05242/integrity","json":"/paper/2601.05242/citation-record.json","paper":"/paper/2601.05242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"cited_work":{"arxiv_id":"2505.15612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15612","snapshot_observed_at":"2026-07-04T09:19:43.881659Z","title":"Learn to reason efficiently with adaptive length-based reward shaping","venue":null,"work_id":"6baef149-2491-431c-a612-c9fea9b25a16","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2505.15612","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:7883648b591fa6b9f5f8746afc62a112359798f457152e8fc7d4c8dfcc52d375","observation_id":"6db48e9a-15f4-4c36-8b2f-f582bbe38f7d","resolution":{"observed_at":"2026-05-15T05:31:55.906712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:64eb20316314a15d70bbdba470044b38c931a95c4c0f212307570eeba04f23de","observation_id":"98645355-1915-40ff-b637-5116521dd9aa","resolution":{"observed_at":"2026-05-15T05:31:55.913738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rule based rewards for language model safety.Advances in Neural Information Processing Systems, 37:108877–108901","venue":null,"work_id":"ffeb3f81-2b5a-49b6-a612-0abc709095b6","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:9a15bc11a361602ec5dd83970aa50dc56c167aadf6bee0c0e1708c663b9c87b0","observation_id":"e9050e69-1f99-44df-aa7c-b1d83dad6a32","resolution":{"observed_at":"2026-05-15T05:31:56.106902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grpo-care: Consistency- aware reinforcement learning for multimodal reasoning","venue":null,"work_id":"a856fcde-b204-44aa-9e8c-074097e7c58a","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:c5c8f67c2e72a4d72f0a4038a7f0d61ead155f28c97ba9669d1bf6967d1abb62","observation_id":"06a78541-2ff2-4350-bb66-443d8c281e9d","resolution":{"observed_at":"2026-05-15T05:31:56.111856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-12T08:24:59.243273Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:90e94345da99bd3929870595481d6101b6dac38af43a4944dc0a3f5dab7d8da6","observation_id":"6a391917-9599-4436-b4e9-948ba9e4c19c","resolution":{"observed_at":"2026-05-15T05:31:56.042488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genderalign: An alignment dataset for mitigating gender bias in large language models","venue":null,"work_id":"00338b58-40ba-449c-8e48-c2b59d3164c4","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:3f58165b11018af4f51aaf8fbae2cb4c919fa64a5d82219721b1baf03cd9d096","observation_id":"ed488f19-4333-4581-beb7-800f1b83b99a","resolution":{"observed_at":"2026-05-15T05:31:56.122088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:4898928ed905826560be2f9aa217bba8c51ca63656e5a453736d321626c86e32","observation_id":"38b085b1-8e2d-4d99-81c2-5aa958f76739","resolution":{"observed_at":"2026-05-15T05:31:56.049954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:8c9147bb4d5015ba982cdce24bcf36c275dd354d4138002086b37f4592a7ae73","observation_id":"6f3fef15-f1c2-41a8-b637-901c74538654","resolution":{"observed_at":"2026-05-15T05:31:56.056480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:16.02596+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:16.02596+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:fe59dfeb6105d8eba0ebde6cc535eef3023269e41625e1ef6c6eabe402e6d819","observation_id":"9b95cd5d-4473-4670-aa64-826cd34163cc","resolution":{"observed_at":"2026-05-15T05:31:56.062395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:7b9b42194dfca5f0a274de47c48cd20fe36031238ae61da00e955af70177db10","observation_id":"df9af16d-d487-48f9-928b-8c01186f69a1","resolution":{"observed_at":"2026-05-15T05:31:56.068850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:4f7493fc2f78f05b3e859dd251c34abbbbeff58e7eca930abc263781396ed90c","observation_id":"2409a2b5-9084-43ab-b4ce-af93af0edb0f","resolution":{"observed_at":"2026-05-15T05:31:56.074559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-12T22:53:24.614753Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":"2409.00920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-07-05T04:40:40.695053Z","title":"ToolACE : Winning the points of LLM function calling","venue":null,"work_id":"1186dcff-a8d4-4766-84c4-1cda266a9852","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:48071f347e62bab760abdbbb0eabd84e589818078b20b395e0e07c882c429387","observation_id":"e80133ac-8ee3-4a92-8171-df8c1e65c19a","resolution":{"observed_at":"2026-05-15T05:31:56.080671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.04587","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:17:30.719460Z","title":"Hammer: Robust function-calling for on-device language models via function masking","venue":null,"work_id":"82d3fcb9-d6f7-4e5c-a7c8-998273bded68","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:de03e041dd89120378d4f50ebb711847a11ca8af430173c4408de822613cbc2b","observation_id":"242b7515-f9f1-49ed-94c7-38bfeb578881","resolution":{"observed_at":"2026-05-15T05:31:56.088678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xlam: A family of large action models to empower ai agent systems","venue":null,"work_id":"0d36e7fa-a5b8-4074-af9f-629adfa33c94","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:6e4aa7b70e4ae6c4cd49a776c3ce8acc308d571a12fdd7ef1daa84607c43e976","observation_id":"04c557e9-7884-4102-bb50-8ebe3fb154e0","resolution":{"observed_at":"2026-05-15T05:31:56.165210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:45:59.150968Z","title":"Qwen2.5 technical report","venue":null,"work_id":"eeff09af-1102-4fc1-a19e-ab55d74373ab","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:9625a1726e9f31e959a60729c2df857543a85be3cb04d6cac155358d2be6e9a5","observation_id":"cdd56d70-f0f5-4d42-9f29-4cf4218f59ef","resolution":{"observed_at":"2026-05-15T05:31:56.170294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:6ccfd00dbba391fcdc26404127ed9d6723a001e5f45823366b0ca2061e2ac02b","observation_id":"f57370dc-2a75-47a3-b204-03f02f21e24b","resolution":{"observed_at":"2026-05-15T05:31:56.094169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models","venue":null,"work_id":"9788b4df-70e9-4fe8-9bbd-847e81fda48a","year":null},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:31ccedde5845b9ec54432cca14af98715672abfb7a44c2332465109806bc4a65","observation_id":"6a920fd8-6ceb-4f85-b353-2bf3c7d5806f","resolution":{"observed_at":"2026-05-15T05:31:56.179757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:de8354c6025f085514c990b1bd3304e89105ba4e47874b58c9dff392d1bbc89a","observation_id":"2f7704fc-3149-410a-81a8-a48fdef83944","resolution":{"observed_at":"2026-05-15T05:31:56.100665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"050b99be-676f-4cbe-84f5-dc7049435497","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:4e4a57f481c2808c6228c5cf781ff6559c798eac98efecf6794c416edeec688b","observation_id":"033c03fb-2b0d-44ca-8f17-a6b1bf6c59f0","resolution":{"observed_at":"2026-05-15T05:31:56.189029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination - aime.In American Invitational Mathematics Examination - AIME 2024","venue":null,"work_id":"96e16404-c7e3-47d3-9ce7-a4122269187c","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:bdb5d207ec4146352b70dbb016d2d2f2787bada2d2b72bb15392980d4f3fa73e","observation_id":"9f051c1a-1581-4354-82fb-04c0e28b1265","resolution":{"observed_at":"2026-05-15T05:31:56.116947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination - amc.In American Invitational Mathematics Examination - AMC","venue":null,"work_id":"68fb8eee-6b2f-43c7-b753-52d7740aa76d","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:2433e417c26b4dd8b11a64d9db1a91b77360919ae252a1aa70308a79b27a7b61","observation_id":"09c8627f-0971-4f0c-a6fe-bfe27007e94d","resolution":{"observed_at":"2026-05-15T05:31:56.126711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:0e59c7a1fe593e9fb6b41318bba49f114540a530dad9dc22d3bc6d194b440212","observation_id":"f407a6ab-91ef-4afc-89ac-98017634d462","resolution":{"observed_at":"2026-05-15T05:31:55.920604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving quantitative reasoning problems with language models.Advances in neural information processing systems, 35:3843–3857","venue":null,"work_id":"aa2326f0-a04a-4481-b188-fdeae9c59e63","year":2022},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:f2354e9f37f4d000307c1c0f957cc1db4379c5b7e4fc4f8621bc41db9981b2f5","observation_id":"03b2a86f-642e-497c-84f0-780900f95b91","resolution":{"observed_at":"2026-05-15T05:31:56.140030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:542b79256be181d6b60de3a825353c682d6c691b6ca219cf3bf7c80d1b1c3fa4","observation_id":"f8d4a327-e825-4350-965a-d96811a0614f","resolution":{"observed_at":"2026-05-15T05:31:55.928839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:557d12094d9b8447334631fd28a2c91b3c42efb52e35c0b52cd848356eb6d0b1","observation_id":"a8543c89-6cde-49c1-98c4-33b94bd3428b","resolution":{"observed_at":"2026-05-15T05:31:55.936117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":"2105.09938","doi":"10.18653/v1/2021.eacl-main.225","metadata_source":"pith","pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Coding Challenge Competence With APPS","venue":"cs.SE","work_id":"c014c12f-1080-4cb2-ae03-ab6b7c09445c","year":2021},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:cf083f28b9ec312dc6e18744a036abda74caa5941a5aef2a01108d72d466dd8c","observation_id":"51b9b410-57c9-4054-84c8-d173c5f2972f","resolution":{"observed_at":"2026-05-15T05:31:55.942554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Competition-level code generation with alphacode.Science, 378(6624):1092–1097","venue":null,"work_id":"bec1f55b-a9cb-4aa6-bcad-cc59083b9ba6","year":2022},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:c6090ebf049d51f189ea9c550db116400a6187bf4cb06b33179450c567d220c5","observation_id":"42a6f5dd-d969-4846-8c27-afdf53712567","resolution":{"observed_at":"2026-05-15T05:31:56.160213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-08-14T08:53:27.956962Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":"2312.14852","doi":"10.48550/arxiv.2312.14852","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TACO: Topics in algorithmic COde generation dataset.arXiv preprint","venue":"arXiv (Cornell University)","work_id":"67740cc1-d973-4614-adf4-686babd14274","year":2023},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:7fab236c3443a9a8743274964af90101fda372a5a8744cfb51cf1aade85c5af2","observation_id":"69f1b680-8e02-4369-9eeb-fa7e214222ba","resolution":{"observed_at":"2026-05-15T05:31:55.949971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:a7099e961888544322853638dc7c47c499994657b4cc3f7b0b166af04e3efcfd","observation_id":"2a2a8774-33e8-46c5-bcb4-130998ac44ad","resolution":{"observed_at":"2026-05-15T05:31:55.957074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:4683eba0e9dd689532ad5c2a19427b06a042a6645574e62c81614b3ebd48d1db","observation_id":"5e188b9f-9df5-4567-8c83-33dd08db7df0","resolution":{"observed_at":"2026-05-15T05:31:55.963435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:dd9f2215697b69087ebc7ffb0507e58f4940ed954d89f1183574eaa1e7aba4c1","observation_id":"9ece9e33-3cad-40c4-86b3-079318eeae4d","resolution":{"observed_at":"2026-05-15T05:31:55.970172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-05T20:52:30.455635Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:74251396767bef603e8d3ccdd505f907161fa3f93c886a14bda73b322ecdf3c6","observation_id":"639e8c14-3980-4fb4-a234-08fec123b9f1","resolution":{"observed_at":"2026-05-15T05:31:55.977831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15110","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:55.957384Z","title":"DLER: Doing length penalty right – incentivizing more intelligence per token via reinforcement learning.arXiv preprint arXiv:2510.15110","venue":null,"work_id":"ba052973-9910-4d57-9065-b466df850941","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:92a7edfacd20ae41679672870f4e289d6d21df0927609f6126cff5669b1cd17b","observation_id":"d2b32c19-8c2a-4eef-8563-03b99e8c74bd","resolution":{"observed_at":"2026-05-15T05:31:55.984403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2310.12773","doi":"10.48550/arxiv.2310.12773","metadata_source":"pith","pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","venue":"cs.AI","work_id":"45bf2da5-62a0-441e-b0fc-77d659b681db","year":2023},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:74d471f21276046df65cbc701dea17090c864c8631e71b2f36561c21d81c4838","observation_id":"3a6cb3e7-3953-4541-a511-8a7a39c5ae88","resolution":{"observed_at":"2026-05-15T05:31:55.991381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11564","last_updated":"2023-10-17T20:22:13Z","snapshot_observed_at":"2026-08-14T09:42:02.630726Z","submitted_at":"2023-10-17T20:22:13Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","version":1},"cited_work":{"arxiv_id":"2310.11564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11564","snapshot_observed_at":"2026-07-03T21:18:58.006296Z","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","venue":null,"work_id":"100f24a5-6b6e-4c9f-9e00-7393363856ce","year":2023},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2310.11564","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:514f3c5b03f2adc5598ef7731357cbbd6d4acc760cd4016c9f37394b69806fcb","observation_id":"1368f7b9-ca5c-4869-9a8a-610a1ad1915c","resolution":{"observed_at":"2026-05-15T05:31:55.998279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alarm: Align language models via hierarchical rewards modeling","venue":null,"work_id":"fe95f507-9b7a-486a-b843-01899302064e","year":2024},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:faa431643855d29265a4a486d799fbb57ac35503cdacd4c3d30e58791a773546","observation_id":"f004d14b-2ee9-4297-aab5-2fd59480b0cd","resolution":{"observed_at":"2026-05-15T05:31:56.134533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2ab7499f-fdc5-45c7-9408-759b4a7263ed","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:4e0bcafd752e8b1b8a83213dd0d78536ccedd29b4edf590e8eeb7944f3235b5f","observation_id":"e40f7de6-08a5-470b-ae19-82c9688f6ad7","resolution":{"observed_at":"2026-05-15T05:31:56.144847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":"2501.12570","doi":"10.48550/arxiv.2501.12570","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":"ArXiv.org","work_id":"133f3b9f-d49a-46dd-9844-40063846c9ee","year":2026},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:7c86236bbac2f569ffd0c49b3aa4b85a16f81572413a621156b2797ea829eddd","observation_id":"2fe4f056-f9d2-4b09-aae9-940072415879","resolution":{"observed_at":"2026-05-15T05:31:56.006812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.04463","doi":"10.48550/arxiv.2502.04463","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to reason efficiently","venue":"ArXiv.org","work_id":"ddc0d049-f0ca-4946-aa25-6843f6072e08","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:a5dade0f7a965f564167ea175630ee909e138688b99d60ba7d2555119e701793","observation_id":"df8e3d1b-6163-434b-bc98-6f5aefa008f6","resolution":{"observed_at":"2026-05-15T05:31:56.014140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.21370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shorterbetter: Guiding reasoning models to find optimal inference length for efficient reasoning","venue":null,"work_id":"a147911b-5594-4394-a39d-f4e4768bdc48","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:baadd1db5892b626819b9c53e35f8fd30d35d6f50d13cb3018b82e568481bb61","observation_id":"623a3f8b-50b5-4736-ba2f-d0a0329aa0fd","resolution":{"observed_at":"2026-05-15T05:31:56.021874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-15T06:09:25.789897Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:0fe77aadc2d344925ad1bf18e1147f775c8476803d48d38773bc8bd52d264851","observation_id":"ff693d59-b172-4e5b-a32a-fe37107681d4","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":"2505.18298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-07-04T09:19:43.854814Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards","venue":null,"work_id":"3e34189b-2679-47d3-96ef-27405bed04a7","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:cd72f18d5777b6c49f6f84849c67a8dcf0796bad6d922f491b5f78a5695557ff","observation_id":"56fffa5f-907e-49f8-a5be-9506a292801d","resolution":{"observed_at":"2026-05-15T05:31:56.036833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"name”: “Tool name","venue":null,"work_id":"290ca368-d90d-4c4b-a855-5db34b2bd339","year":null},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:8dd440cfba7fdff34fb3ef1b9e38a65b0b314cfdbea6d337d07aef3bdd3101a6","observation_id":"4462bb69-b228-49e2-b8ed-655ed551cd64","resolution":{"observed_at":"2026-05-15T05:31:56.155044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provide at least one of <tool_call> or <response>","venue":null,"work_id":"964cb8e6-d07c-4cf3-bebe-ab832fea04ee","year":null},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:636d498e6f0f25e87945bcf96cd43a4fdf1a0ed0fde7a6e9fca80fab7582d847","observation_id":"edbdaf2a-ca9b-4571-96ce-326e1a5fd59f","resolution":{"observed_at":"2026-05-15T05:31:56.174769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"name” field and a “parameters","venue":null,"work_id":"459e46e4-5b59-4eb7-9b9e-b6e4f150448d","year":null},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:1066c3b3e3f2797ea976498688e4afac3f152877d1cd9d079eef3c443ed200f5","observation_id":"d4725689-072e-429a-96c7-dd007c65aacb","resolution":{"observed_at":"2026-05-15T05:31:56.184654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0a38de10-3e06-4031-8475-ae5b7e6073f9","year":2048},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:1cdc775728ae96b4445e05cbc1a6b531d6b4e2382622e72213085ca8ad981c3d","observation_id":"f5d41f42-55fa-4189-8c08-eec6f960f937","resolution":{"observed_at":"2026-05-15T05:31:56.150053Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":28,"verified_fuzzy":14},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 75 inbound Pith citation observations for arXiv:2601.05242."}