{"as_of":"2026-08-08T15:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8304499b306b35a650d3b3d8339b05981563de2e82b97f9a177cfb2694c3e1d3","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T09:01:03.618498Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30201/citation-record","integrity":"/paper/2605.30201/integrity","json":"/paper/2605.30201/citation-record.json","paper":"/paper/2605.30201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Enhancing reinforcement learning with dense rewards from language model critic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:542668e7bbddf1ab044336068d604ba117f736f3f8c65b7b954a699f1c972e9a","observation_id":"e39a9985-dd35-4723-b520-3d5480392985","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:9a6a031868832184e599ea0791d60bf72255034dd1cdd2b4861cfc5976b65a31","observation_id":"69caea79-9fe4-46ea-9d42-fd4eff773694","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:7c9f25177cab671d450147f9aacd11c1db8281567cbe0cce14ea600d810f3f04","observation_id":"611dcfd6-8825-4c0b-97a5-d13de040fd84","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"DenseGRPO: From sparse to dense reward for flow matching model alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:be4120f3da8123cf39288a43e9d0a6ceebff6cc9dfbe8a4b6817f80ec512c1a5","observation_id":"7d5d61ed-08a6-4266-9fb1-27a59694138a","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:5dc37b6d272187b95cb1666de9cc4e85ce23fab51f6180482b8c9db9b83ddeea","observation_id":"39fc10bb-581c-4451-91b6-d2f5bce7668c","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Re- wardmap: Tackling sparse rewards in fine-grained visual reasoning via multi-stage reinforce- ment learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:96b576a3b3bd26c7ce5631aa355da3fd336b45662b49b97c10e5e5e4eb34dd6f","observation_id":"bab408fa-a595-4120-b294-c0ef882a71b7","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:4c8a9c4b0e1fb01c0d19c1d433d0c23ef2f2667121e39042f04ece5bbb798dd4","observation_id":"aacf218f-d7d6-47a5-929d-39514e07cbd5","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Soft adaptive policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:9ffa1e09c7f6fbb12a652497d67e3dd4a00bcef7d436703f12c5bd1e8ccd0a5d","observation_id":"09a5a2da-c1e2-455c-84b2-a5f5cd768f49","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:944f9940bc53209dd8af05c9cdfbc1123a589e9f1a4678808975a77c203ec570","observation_id":"bdf835ff-720b-4f43-ac3d-6abf490b13b4","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:133509f2fa62d98d15396127b0c47ab9cfbce431db2d4abf7b2255c51f215847","observation_id":"1f0f7608-ec8c-4634-959c-e421be09efc5","resolution":{"observed_at":"2026-06-29T09:03:15.687060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:76d58651ca417f93fde558d1edf229b4dce4c9d9299d385e607a4e1a69ad5a52","observation_id":"a82861da-32fc-4f52-9bb3-d870baa9158a","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Hysteretic Q-Learning: An Algorithm for Decentralized Reinforcement Learning in Cooperative Multi-agent Teams","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:2732159ac7251868314491cd25903568aac9e3facfca759fb178f686d2543239","observation_id":"90001c7c-6a19-4a2c-9d22-7af35690bd14","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:23fb4923145650e4e89bf3267968e2db795fdc32357c98fa41212c71d06dfd36","observation_id":"ee0fb757-c0d5-4099-b7ea-692ddbb5cc69","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:d203042072eb3b84b50168f772e3cd0a02abbd0f859e43d69b658b669c73096a","observation_id":"f9c2ff86-5807-4dd2-867f-535ac000ceef","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:2998a190e32005c96cc2fc773c34bddf319da14ffa45c31f8b653b9868014bd7","observation_id":"79636ff0-2e79-4f0f-a5f1-4bf6fb3644df","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21974","last_updated":"2025-07-29T16:21:42Z","snapshot_observed_at":"2026-08-08T11:11:33.693120Z","submitted_at":"2025-07-29T16:21:42Z","title":"Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks","version":1},"cited_work":{"arxiv_id":"2507.21974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21974","snapshot_observed_at":"2026-06-29T09:03:15.685485Z","title":"Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks.arXiv preprint arXiv:2507.21974, 2025","venue":null,"work_id":"f89c2bba-1e6a-4aff-b3f8-3f15e85c4b35","year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"cited_paper":"/paper/2507.21974","citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:66d6b373a997474674dd6f7b02a4735bc01c1d7d5da9f015b85b74d46cfa1863","observation_id":"17f6492f-5404-4f03-9f86-2988ac74c19c","resolution":{"observed_at":"2026-06-29T09:03:15.687531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:0c2d94ca2de2ffb8d86c81665a7d52408e3276b01cdd2ba5c71a42eb64ab7116","observation_id":"88713596-c662-4a69-bfc0-466991631b9e","resolution":{"observed_at":"2026-06-29T09:03:15.690088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:bde5973f98f4222612a2df05cdcb0a23815c205310a80e0663c2f48cdeda48ed","observation_id":"b576e0ec-3515-4803-9bf4-6852d2adfd61","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:afeaae9b8f86a87649e256e5a18c680ca8a1d63454e3c020e5fda141f05c7ba1","observation_id":"4839da91-6396-4c61-a9ed-26222be91207","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:2b94a4489eae068a60848346067ead600ff2b8e6826563a9692a4c09386528e3","observation_id":"f3b0af17-308b-461f-88e6-68848bae52c0","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:3543daf72071d5b33f2f44f3efce4682c35b0bafda134b10b2a1d282e1011488","observation_id":"3ad9e361-91c0-4369-aa80-4692c14bd898","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:80a2155eb1f88c40c73c9c680d7fce99d1c8fb6a149984731d62d75b22503124","observation_id":"29e2724e-02d8-4372-9a41-891c4beb1d01","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:01:03.618498Z","title":"Group sequence policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T09:01:03.618498Z"},"links":{"citing_paper":"/paper/2605.30201"},"observation_digest":"sha256:7828f83b8d26e5974a39df67e95663e9a5ec5e55bcfb50c03312cfa7ae566256","observation_id":"ff42b07c-5c05-402d-a176-6895a276780d","resolution":{"observed_at":"2026-06-29T09:01:03.618498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30201","last_updated":"2026-05-28T16:38:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T08:46:55.431799Z","submitted_at":"2026-05-28T16:38:21Z","title":"HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2605.30201."}