{"as_of":"2026-08-06T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd743ebf793abd22dc3fcae90366f0da1ea7853655c4a065ee8f2dced6bec745","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T19:16:21.044294Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:42:46.659305Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T07:24:22.372634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"cited_work":{"arxiv_id":"2605.13217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13217","snapshot_observed_at":"2026-06-30T07:24:22.372634Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","venue":"cs.CL","work_id":"dd984b34-9d4a-4a17-98d4-7f250ad31cc7","year":2026},"citing_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-03T00:43:32.504636Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-30T07:15:44.387347Z"},"links":{"cited_paper":"/paper/2605.13217","citing_paper":"/paper/2606.29502"},"observation_digest":"sha256:b410b7374977d30e960324932de15e0e0758d95b0b26267997d647cbdff3cf84","observation_id":"9ff7e3b0-ddd7-473c-896f-1beacdafe077","resolution":{"observed_at":"2026-06-30T07:24:22.373961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13217","snapshot_observed_at":"2026-08-02T09:42:46.659305Z","title":"A DETAILEDPROTOCOLS FOR THEOBSERVATIONSTUDY We give the full experimental settings and protocols behind the observation study in Section 2, whose schematic is shown in Figure 2","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-03T00:43:32.504636Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:42:46.659305Z"},"links":{"cited_paper":"/paper/2605.13217","citing_paper":"/paper/2606.29502"},"observation_digest":"sha256:6a7e311a19dabebca7146bfc21f9dbcccdc6cdcdd3e3bfed71034787c5532ffe","observation_id":"48307fe8-b475-4cac-8e9a-3e8fe90068d9","resolution":{"observed_at":"2026-08-02T09:42:46.659305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13217","snapshot_observed_at":"2026-08-01T04:25:58.515880Z","title":"arXiv preprint arXiv:2605.13217 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27631","last_updated":"2026-07-30T03:42:52Z","snapshot_observed_at":"2026-08-02T23:36:34.846105Z","submitted_at":"2026-07-30T03:42:52Z","title":"ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T04:25:58.515880Z"},"links":{"cited_paper":"/paper/2605.13217","citing_paper":"/paper/2607.27631"},"observation_digest":"sha256:44f8b7afe1d5c0b688ee00130c877aab5b3e73cff021b28fdbbe25fac3a0c447","observation_id":"bcc855fa-c7bf-4e39-ae5a-e33fb562aa6a","resolution":{"observed_at":"2026-08-01T04:25:58.515880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.13217/citation-record","integrity":"/paper/2605.13217/integrity","json":"/paper/2605.13217/citation-record.json","paper":"/paper/2605.13217"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.238303Z","title":"2022 , eprint=","venue":null,"work_id":"5903b651-f252-45b3-9845-98a1abf380ae","year":2022},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:a2484cbeb387458895c2542b54af3e711eb0b5b8444666b67fc6cb2207049b50","observation_id":"cbbc7015-3c22-4a33-b917-be33c545f151","resolution":{"observed_at":"2026-05-15T18:40:16.094463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T06:43:29.957941Z","title":"2025 , eprint=","venue":null,"work_id":"92a933bb-6195-449a-8230-f8407d9b8afc","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:a8fed6725387d7801d2cac10bcda561535fc6ff7593c108aa91795dccc35a4bc","observation_id":"70bf1b90-c971-4398-a9d3-d016db727b9f","resolution":{"observed_at":"2026-05-15T18:40:16.105478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.488352Z","title":"2025 , eprint=","venue":null,"work_id":"8fb5d482-cf5e-4141-b15a-3f607aa09f83","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:8c070b496b0c0f612cffcc35ca7e93cd14798c84d1d5d6d1cf448952b49cb399","observation_id":"595233b5-3418-480a-b5ce-9bd604bf2ea6","resolution":{"observed_at":"2026-05-15T18:40:16.071516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.775981Z","title":"2025 , eprint=","venue":null,"work_id":"26c7b6ed-f86e-4ed8-b9ed-b1783d90255b","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:025aeffb6f9849b792432421f5239a14b818bff90cddab4a91b3b32cb2e197df","observation_id":"9d1bd90e-dd9a-4c5d-9d3e-e536c3ae09bc","resolution":{"observed_at":"2026-05-15T18:40:16.098623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.243842Z","title":"2017 , eprint=","venue":null,"work_id":"5a794cfe-c0fb-4191-a347-b4e935d39d00","year":2017},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:cc5d0bdec847040224c10079fb8f53f807c20c113329b74545b982ed706571d6","observation_id":"d887abf4-2cc2-44b8-addb-b50ceeaa7f9d","resolution":{"observed_at":"2026-05-15T18:40:16.079422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.813628Z","title":"2024 , eprint=","venue":null,"work_id":"a89a4563-79a1-421b-94b6-2cf0795d3c66","year":2024},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:50cd3a9ad32bfb8b8846e26926b8a1a69e2befc38b2fac16ba730789edb63a8c","observation_id":"20c46a80-d413-43d6-9c70-7f160210adb6","resolution":{"observed_at":"2026-05-15T18:40:16.082989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"4363c6dd-106a-444e-8a9e-5151483563d6","year":2024},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:736c920601d428a326ce3233c61f4b54cb2a951aae59deef1dbb09045afce2aa","observation_id":"3b643846-baa4-4854-9f8a-ea6653a0ed26","resolution":{"observed_at":"2026-05-15T18:40:16.075661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.880105Z","title":"2025 , eprint=","venue":null,"work_id":"23c9ed8b-0801-487e-b54b-89ecae58740e","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:d602b0766c22a3757da397a5fdd9f4dda283f255eb99b9b37e707694ba3394f7","observation_id":"6a1ad738-eb3d-4ec6-b147-fa83a730786d","resolution":{"observed_at":"2026-05-15T18:40:16.086415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:00.657932Z","title":"2025 , eprint=","venue":null,"work_id":"4f181d9c-9406-4386-8905-556c2af14bff","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:58269ab65e0e0e85ea576f81501be160e5fde001fef6bb416bc11df96d6729b2","observation_id":"d73b33de-3eac-4d40-b453-653b3811e8e4","resolution":{"observed_at":"2026-05-15T18:40:16.090438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:58.153799Z","title":"2025 , eprint=","venue":null,"work_id":"2c4fb2d4-2f18-42f1-9e81-9e6825636669","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:bcc67c73593fd51589da8a5bc60e9b4b85ebe47c68782adb2a5d25283ec178e3","observation_id":"f86889d1-150e-4d19-b4db-090765d786e1","resolution":{"observed_at":"2026-05-15T18:40:16.127042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"15a86e93-936e-4fad-9aa9-83c9e81530e8","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:39b0d03258288eb12b564fd553cd58ff8a7ebdbbc4bd6929936a1617e85bc0de","observation_id":"b78c6455-270c-4560-8807-41cc166211c6","resolution":{"observed_at":"2026-05-15T18:40:16.109035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"eb3ccc74-213d-4f39-930b-d3413e4ad4b1","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:b1243e66eb545c590e85424db74cd76c75361aabce76156b5407d43f513429a7","observation_id":"4b289d4f-44fc-4a1d-b62f-f6bd82d04e4c","resolution":{"observed_at":"2026-05-15T18:40:16.134931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:42:52.121458Z","title":"2025 , eprint=","venue":null,"work_id":"339888b3-dff2-4876-8d7b-c46f60ba842b","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:da680e6053918319b53caa1dd4efb9b40f37a8aa2651b06fc4044e846c3af06c","observation_id":"ef520a4f-121f-49e9-ac3f-099bba6736f6","resolution":{"observed_at":"2026-05-15T18:40:16.159841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d8639990-33f9-4834-9ceb-15b1cb091c5d","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:1736ee5b8fd56a87b468d67cf080785e07cd6122157a16161a5ed225c1190807","observation_id":"65bd5ffe-ee03-4be1-8c63-4b493be695f3","resolution":{"observed_at":"2026-05-15T18:40:16.102089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"c520d4bc-2990-456c-8e42-b5608a028767","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:99c322518342b7309f87941f8dae730c44ef93b9c530f1ceb9b178c4d6c993ed","observation_id":"d025b346-ff84-4a52-b51d-9de58f3722d7","resolution":{"observed_at":"2026-05-15T18:40:16.152563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"561490e1-c156-4206-a668-6d4adc80fd29","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:0d74fb872cefd5674a4ca0ec5601f442bafa63b398704892762064607d2afa8d","observation_id":"ab66e6b7-7a0b-4142-ae67-86e4c04cb254","resolution":{"observed_at":"2026-05-15T18:40:16.131688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"478a5d2a-0e7a-43f2-a590-2ea696e5093d","year":2026},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:69e1736b660c4a6fce99ca6e472595591610e711e2b62cb5d553e9993fefdf04","observation_id":"62633f41-a942-47c8-a4e5-b9e823df0bb3","resolution":{"observed_at":"2026-05-15T18:40:16.186329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"3ecd6ad0-c8cf-4238-a68e-688848077820","year":2026},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:5e8bf0c725d8d212a72d746374287865aa474430e55d25c43a69f195186ff210","observation_id":"ec8c26c2-45bd-4ba1-a7e8-1cbd6b608851","resolution":{"observed_at":"2026-05-15T18:40:16.142330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"3f010be7-2100-457a-97e8-01ff5029f6b6","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:6660452d95eb4a6dfeb3a505e6506e8e7e426b8cd40e4f19047c7e98e4ac6140","observation_id":"7adf4125-7a1b-4234-bfc2-8760396c2c6d","resolution":{"observed_at":"2026-05-15T18:40:16.139030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"eb9915af-6adc-4c92-a9f5-4520ec683dfe","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:0eaecb5745f9afedcf83a9d3b866214dae0c5de37fc0b732fa1e4adc8d12b169","observation_id":"f2c80ecd-99a3-4b24-bc56-f8137cb31db4","resolution":{"observed_at":"2026-05-15T18:40:16.164283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"9702aebe-c512-4ca0-8025-5823a958d4ad","year":2026},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:124a0799ee58688ddf0b49b2b8f6874f2df63f0e8d73d879bac8d71f500d94b7","observation_id":"63b48190-9c8d-412f-b3ee-3f599262ace5","resolution":{"observed_at":"2026-05-15T18:40:16.145293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:20:43.739620Z","title":"2018 , eprint=","venue":null,"work_id":"e30f54d5-f1db-4337-8d5c-421e8f757763","year":2018},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:a3b4175ab45c2eb823c7a7c4fa1f315b51df10f0d5856a47af19586da906a1d1","observation_id":"d14ba52e-72a7-46d3-9d92-60c4ae0f5149","resolution":{"observed_at":"2026-05-15T18:40:16.119604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.175074Z","title":"2024 , eprint=","venue":null,"work_id":"d91f5ad8-9be3-4ce1-b79f-8f0030ecf52e","year":2024},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:28bfef9df073b217726d42912be6afa05e594d8feb30cfefdca7001a61b82e74","observation_id":"a8781dfa-7ce5-4640-aab5-ed6d6cb2ae59","resolution":{"observed_at":"2026-05-15T18:40:16.167680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"36682c65-74ca-43a5-a2c3-8eb8c74e1a1b","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:8f58e0a36b9dc54d84f0732a30ad6308a57cdb9cd38156057491118804187fff","observation_id":"756f967a-4eef-40a0-8da4-a928d667d776","resolution":{"observed_at":"2026-05-15T18:40:16.155888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"54308fe8-0176-4f01-8911-da9822375c85","year":2021},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:f2fc16bcbbb4b59b7864faa547d0fb443baf1d65292335d10c9aa52c59e615b5","observation_id":"f63bdd1d-135c-4509-a0fd-63a0eb572def","resolution":{"observed_at":"2026-05-15T18:40:16.115620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:56.763059Z","title":"2023 , eprint=","venue":null,"work_id":"c56e38a5-7e12-4846-ab7f-4df20cb62386","year":2023},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:3da90a530dcd489ef102a05e6c19c1fbe9db42b1d9ee6589830876175745bc7a","observation_id":"ec302352-7e59-4f27-88c7-e032a7d638a1","resolution":{"observed_at":"2026-05-15T18:40:16.148885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.293428Z","title":"2023 , eprint=","venue":null,"work_id":"27fbc932-16e8-4a81-9c18-25a71f321895","year":2023},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:7bc80f6a6da4fe28697138943d51023b2133a819769d0a90bcba911aba5aac34","observation_id":"cbcdcee3-2dee-41cb-9be8-aa08f5497202","resolution":{"observed_at":"2026-05-15T18:40:16.181716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T03:43:15.347347Z","title":"2023 , eprint=","venue":null,"work_id":"9e726140-07d9-49d4-b4fc-1ce0d03d41ee","year":2023},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:9258a6d492ee1af9bc279ad0f1a8d290409fc6b557e22cdf2a1169d37e5d39a0","observation_id":"dc79db85-fdbe-4e09-a633-3f8129353d31","resolution":{"observed_at":"2026-05-15T18:40:16.174299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"47a31a39-a341-49ba-87ae-1c7cd871b87c","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:e87408e6ec4f5b442799c96ccf43cdc40ba2ac22664c5613bc321c703efb98e6","observation_id":"b65b558e-ac0d-4d80-ad6d-ca01bb8fdcff","resolution":{"observed_at":"2026-05-15T18:40:16.112240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"d5b98992-a326-4c31-80c5-e68a05545a2d","year":2026},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:9b602f24e067452be1ed550580c82ee84b298041b71b39f385655cd8679d4e38","observation_id":"b200497f-de6d-4ace-867b-9de833b47c31","resolution":{"observed_at":"2026-05-15T18:40:16.178429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:42:52.126756Z","title":"2025 , eprint=","venue":null,"work_id":"6a97296c-6059-4c93-ad24-0f03055aeebd","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:811a33b9607024dbbbbb526b28a621e2ae13440e3aa2e0575f5417b9e8f48b12","observation_id":"14fd5314-4b8e-4069-90e5-0aeca21f3245","resolution":{"observed_at":"2026-05-15T18:40:16.170867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:36:12.788904Z","title":"2025 , eprint=","venue":null,"work_id":"b1a2cc9b-8086-427e-830d-991890d05419","year":2025},"citing_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-14T19:16:21.044294Z"},"links":{"citing_paper":"/paper/2605.13217"},"observation_digest":"sha256:32d70da976fcbf6a260449175f518357e5834ffcde5e19447a40e10488092c63","observation_id":"fd1f8f90-c756-4629-b611-436887fdce3f","resolution":{"observed_at":"2026-05-15T18:40:16.123418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:2605.13217."}