{"as_of":"2026-08-10T20:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7937089e5d0522ec10bfcd91b8b27195b9d03348622b2e7aad0bd7f4ad0f353","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:41:04.563390Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:10.552803Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T15:15:47.315708Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-08-07T15:20:10.552803Z","title":"Hybrid Group Relative Policy Optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-10T05:24:24.411872Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.552803Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:1437a51ad5c572b76b3a91155559beec0d62e8d717aae212c2db2e02f832dbc1","observation_id":"ae8c1636-467b-47d2-9de2-31f898d0f24a","resolution":{"observed_at":"2026-08-07T15:20:10.552803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-08-07T14:46:17.575076Z","title":"Hybrid group relative policy optimization: A multi-sample approach to enhancing policy optimization.arXiv preprint arXiv:2502.01652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17697","last_updated":"2025-05-23T10:07:18Z","snapshot_observed_at":"2026-08-07T21:54:30.483014Z","submitted_at":"2025-05-23T10:07:18Z","title":"Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:17.575076Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2505.17697"},"observation_digest":"sha256:1f387d677c2bf15e7e06cf58e9aca51449455a368f1aaa0f2f603ade75abb455","observation_id":"e7818414-6f38-458f-88c9-6ff2bb6c12b0","resolution":{"observed_at":"2026-08-07T14:46:17.575076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-08-06T17:47:40.317048Z","title":"Hybrid group relative policy optimization: A multi- sample approach to enhancing policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.317048Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:2ff36d667aa9926b37174a9e982918fdaa4d30b7144fe5a0d2a2a34556da2466","observation_id":"26f352d2-bb61-4b59-9368-03abe5d0fc8b","resolution":{"observed_at":"2026-08-06T17:47:40.317048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-08-06T15:02:26.981947Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-09T18:26:18.572534Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.981947Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:46f16ceb8353497aeec8d220dd279f78fc02174ee9d205956da7a88a8e896e9b","observation_id":"82dad115-11ff-4a67-b5ab-5acc990cc05b","resolution":{"observed_at":"2026-08-06T15:02:26.981947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":"2502.01652","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-07-01T15:15:47.315708Z","title":"Hybrid group relative policy optimization: A multi-sample approach to enhancing policy optimization","venue":null,"work_id":"5af8ca5e-db09-4b53-a6f7-21ceb2cc5f44","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-08T17:29:54.591443Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-21T06:08:55.571828Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:bc4589430f897b4864fe0270c2015f35f72d300480db1ef7de443b1b7cbc5aaa","observation_id":"a77361da-145c-4ce6-951c-ceb4e777e034","resolution":{"observed_at":"2026-05-21T06:09:41.327840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":"2502.01652","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-07-01T15:15:47.315708Z","title":"Hybrid group relative policy optimization: A multi-sample approach to enhancing policy optimization","venue":null,"work_id":"5af8ca5e-db09-4b53-a6f7-21ceb2cc5f44","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-08T17:29:54.591443Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-30T17:15:53.286925Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:ab69bfc411cabace2f636d90553d7fa4ca0b78492969b829e57e9dd567405e50","observation_id":"e5fcd091-6d8a-4b24-85f8-3451dce56e07","resolution":{"observed_at":"2026-07-01T15:15:47.317545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01652/citation-record","integrity":"/paper/2502.01652/integrity","json":"/paper/2502.01652/citation-record.json","paper":"/paper/2502.01652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T22:41:04.505966Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.505966Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:3b4f364e56b2d6923590b6afb28f116b87c6d446ed7c20c195e11fd3ce70cda9","observation_id":"2127b893-b24d-4cd7-9845-ba120ba0d9b5","resolution":{"observed_at":"2026-08-09T22:41:04.505966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.765604Z","title":null,"venue":null,"work_id":"d6008c53-4957-485d-bbb5-cd2231d2e9c1","year":2025},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.510790Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:135881e8a7ce55ad22322660d4ffed54b70754b6179a0b40fd85d002385f23d2","observation_id":"4315583f-a384-4d71-8374-b398ba438e36","resolution":{"observed_at":"2026-08-09T22:41:04.769450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.754206Z","title":null,"venue":null,"work_id":"313fa3ed-888b-4485-859f-dd6761494661","year":2008},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.515647Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:3c7262796ab080c0e49e95bfac70aa7ac2c2db1993ff3219815adb81b703d0c3","observation_id":"f41338f1-11a4-47c4-86fe-dcc021e27a3a","resolution":{"observed_at":"2026-08-09T22:41:04.758001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.741384Z","title":null,"venue":null,"work_id":"1e31348b-44e8-4c23-b562-bac00dea3f10","year":2018},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.519748Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:49417d195742542fba3fbf235c79feae5eae0d8bd4ce254143e66dad8594051c","observation_id":"ad30ddcb-aef3-41bb-9eba-6c4bff633a0f","resolution":{"observed_at":"2026-08-09T22:41:04.746557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.729237Z","title":"S., and Barto, A","venue":null,"work_id":"1dce8062-e385-462f-8165-82d8061c646f","year":2018},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.524232Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:75af4acfab2fe82ef881a983a25a969ffd308ed5443ae7fe045221647cd90567","observation_id":"13df8e24-49a2-42e7-8a3a-44d7a1a4061d","resolution":{"observed_at":"2026-08-09T22:41:04.733422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.715800Z","title":"P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., and Kavukcuoglu, K","venue":null,"work_id":"e0629d4d-0c3e-4f26-9424-a1abfa153a43","year":2016},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.528530Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:dfb925ce6637f5bfc95e4a1326cae2cf480cffc2fb017d7f39785eaab397035b","observation_id":"1cb49423-ef76-41ad-8d3c-8ad9c65fd9f7","resolution":{"observed_at":"2026-08-09T22:41:04.720319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03073","last_updated":"2017-04-10T22:29:50Z","snapshot_observed_at":"2026-08-08T15:23:20.688003Z","submitted_at":"2017-04-10T22:29:50Z","title":"Data-efficient Deep Reinforcement Learning for Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03073","snapshot_observed_at":"2026-08-09T22:41:04.533273Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.533273Z"},"links":{"cited_paper":"/paper/1704.03073","citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:2bfaab0714e224e22f14ed531af794875559ff11b93c97acac08316bca948224","observation_id":"783b9cbb-85ed-4a2d-b019-7adaabb2421f","resolution":{"observed_at":"2026-08-09T22:41:04.533273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.701561Z","title":null,"venue":null,"work_id":"20cf803e-2fb1-4b7f-ad97-8cb5765b1941","year":2018},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.537907Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:d4bc85784459d7bb93acade73970bc6cca0ca9a2cd4b5171c9ae3bff8d2699af","observation_id":"7ee1b285-6723-4e72-bd28-f54cea488763","resolution":{"observed_at":"2026-08-09T22:41:04.706050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.686185Z","title":"J., Guez, A., Sifre, L., Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., and Lanctot, M","venue":null,"work_id":"5e55cb9c-441e-4a39-bc0b-6c04ea03e00f","year":2016},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.542148Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:c5d3e8419f0d0b0db11ca1432445af0f74b0105d6f781062c0c0d8f58f00e507","observation_id":"8c6b52ad-e4cd-47f2-9f56-631f3a6bfdf5","resolution":{"observed_at":"2026-08-09T22:41:04.691406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-09T22:41:04.546306Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.546306Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:99f524080e3b247a707a457c1ea47afedcef4f121668c9c29fc5c19606a006c8","observation_id":"24261d01-3c06-479e-8c75-894c1965c93c","resolution":{"observed_at":"2026-08-09T22:41:04.546306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.673388Z","title":null,"venue":null,"work_id":"29b75329-a474-4a82-9fba-b6a8990e158a","year":2023},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.551034Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:cb71a577ad6a5fd8bcae5ee11af3d73982413e2b2c9b8e8489fa402d3c658b06","observation_id":"bd277b80-0b3e-4913-8454-2c925ba2ef64","resolution":{"observed_at":"2026-08-09T22:41:04.677455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.660361Z","title":null,"venue":null,"work_id":"6abe38e0-860b-40f4-9508-7e5431c3f23e","year":2020},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.555362Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:d9643963db24b7751cbc10f5632ec2a27b2f180a582672039855e005ed20bddc","observation_id":"207a0b77-7332-495e-808f-eba08502c127","resolution":{"observed_at":"2026-08-09T22:41:04.664529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.646647Z","title":null,"venue":null,"work_id":"02f7f68c-d766-4aa9-be91-4a679633263d","year":2025},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.559398Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:f8bbd9bd54893246e952d9204b43e960e3f37aba36cebda1a92e5e94867ded60","observation_id":"e196a6eb-6410-4ef2-a40a-bba0f60594b4","resolution":{"observed_at":"2026-08-09T22:41:04.651156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:41:04.632388Z","title":null,"venue":null,"work_id":"db2e5bc1-c927-4959-a755-bbce3e774abf","year":2025},"citing_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T22:41:04.563390Z"},"links":{"citing_paper":"/paper/2502.01652"},"observation_digest":"sha256:acfa0a803848adda5161dd3070324779b4a4150d6bf5d8b2e7efb3a181e24587","observation_id":"5681b994-1d1f-44fc-b216-b4d54bab2baa","resolution":{"observed_at":"2026-08-09T22:41:04.637523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T22:34:50.871350Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 6 inbound Pith citation observations for arXiv:2502.01652."}