{"as_of":"2026-08-08T06:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be31ba02aadf821e44e07e298a84fe15715f593fbfdb9e1d5e13f38d892b8544","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:10.726696Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15514/citation-record","integrity":"/paper/2505.15514/integrity","json":"/paper/2505.15514/citation-record.json","paper":"/paper/2505.15514"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:20:09.297380Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:09.297380Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:c5f7141984a061fde2ebcd29a5733bc3e7b9aac624cc09dd6281ef46a567196f","observation_id":"2f8e8f95-bed7-4abb-991a-6b4c06079e05","resolution":{"observed_at":"2026-08-07T15:20:09.297380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T15:20:09.391259Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:09.391259Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:a40310f460e7d6fc8f6e576f29dfe89e6503537c48f0c5c0efc59fe790169384","observation_id":"1b7fa24e-391a-4a7e-b549-2a4f6838d583","resolution":{"observed_at":"2026-08-07T15:20:09.391259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:12.240557Z","title":null,"venue":null,"work_id":"f4d5d036-3636-4c3a-94fa-71460dc2d130","year":2025},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:09.516514Z"},"links":{"citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:ff6e3f02251fc2334ac7e37bf30ea073621ddf9bc8adf5239fe9101701a105aa","observation_id":"09309aad-767d-481d-99e8-4a821be3e262","resolution":{"observed_at":"2026-08-07T15:20:12.319905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:09.638561Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:09.638561Z"},"links":{"citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:18fdb1dd0b7394c493e59644afa9ce75a934317f9d4f5a51cebd994f92e75487","observation_id":"aaabaec7-4b2b-4157-99bc-d82a5b7438e9","resolution":{"observed_at":"2026-08-07T15:20:09.638561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00752","last_updated":"2023-02-01T20:55:38Z","snapshot_observed_at":"2026-07-06T14:47:27.086882Z","submitted_at":"2023-02-01T20:55:38Z","title":"Sparse Spectral Methods for Solving High-Dimensional and Multiscale Elliptic PDEs","version":1},"cited_work":{"arxiv_id":"2302.00752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.00752","snapshot_observed_at":"2026-08-07T15:20:11.550617Z","title":"Sparse Spectral Methods for Solving High-Dimensional and Multiscale Elliptic PDEs","venue":"math.NA","work_id":"dbfca55c-c964-4c8c-8773-02c4994bd0c3","year":2023},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:09.745245Z"},"links":{"cited_paper":"/paper/2302.00752","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:212c1c54cec6b42fd0b7cd801b564d09b0f4c6f5e86a3bcfb28f5a6ce6412085","observation_id":"6f4f7792-e7ab-4c28-9300-503eee4e5702","resolution":{"observed_at":"2026-08-07T15:20:11.625988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13951","last_updated":"2022-05-27T12:54:56Z","snapshot_observed_at":"2026-07-06T13:14:41.364309Z","submitted_at":"2022-05-27T12:54:56Z","title":"Topological nature of the transition between the gap and the gapless superconducting states","version":1},"cited_work":{"arxiv_id":"2205.13951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.13951","snapshot_observed_at":"2026-08-07T15:20:11.349764Z","title":"Topological nature of the transition between the gap and the gapless superconducting states","venue":"cond-mat.supr-con","work_id":"cf7a08c5-8340-479a-bc5a-0c3745d1068c","year":2022},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:09.867153Z"},"links":{"cited_paper":"/paper/2205.13951","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:6da23f96c27a9fe965a8115c5c8a91673b5adcd57ec872f3f99cc2272044561c","observation_id":"dc738ca9-7088-466c-8801-abf1cc838407","resolution":{"observed_at":"2026-08-07T15:20:11.443948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13750","last_updated":"2021-05-28T11:36:28Z","snapshot_observed_at":"2026-08-04T00:01:14.690703Z","submitted_at":"2021-05-28T11:36:28Z","title":"A Refinement of the Murnaghan-Nakayama Rule by Descents for Border Strip Tableaux","version":1},"cited_work":{"arxiv_id":"2105.13750","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.13750","snapshot_observed_at":"2026-08-07T15:20:11.173886Z","title":"A Refinement of the Murnaghan-Nakayama Rule by Descents for Border Strip Tableaux","venue":"math.CO","work_id":"4ba18627-a395-45e9-a669-9a3f85b738f6","year":2021},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.003872Z"},"links":{"cited_paper":"/paper/2105.13750","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:2f6157af2535961cb0a1c4ad64dae1003f4aa36d06a8ea31426c0f9e00ac9bcf","observation_id":"fefd7760-a777-45bd-993e-c659221ac575","resolution":{"observed_at":"2026-08-07T15:20:11.240307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08713","last_updated":"2024-01-15T19:34:12Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-15T19:34:12Z","title":"Split NMSSM from dimensional reduction of a $10D$, $\\mathcal{N}=1$, $E_8$ theory over a modified flag manifold","version":1},"cited_work":{"arxiv_id":"2401.08713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08713","snapshot_observed_at":"2026-08-07T15:20:11.004816Z","title":"Split NMSSM from dimensional reduction of a $10D$, $\\mathcal{N}=1$, $E_8$ theory over a modified flag manifold","venue":"hep-ph","work_id":"5ab05bd0-25f5-4d91-8756-fab64ee4a2b2","year":2024},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.112644Z"},"links":{"cited_paper":"/paper/2401.08713","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:8df82b56c6e80337c3eb219961dd72939bd48bedb4bcbb9bdca1c89998296e09","observation_id":"7cd99bac-93f2-40e5-988a-022861c60fb8","resolution":{"observed_at":"2026-08-07T15:20:11.081120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08240","last_updated":"2021-02-16T15:58:35Z","snapshot_observed_at":"2026-07-06T10:41:50.330204Z","submitted_at":"2021-02-16T15:58:35Z","title":"SDSS-IV MaNGA: Blueberry Candidates Associated with LSB Galaxies $-$ Merger or Tidal Dwarf Systems ?","version":1},"cited_work":{"arxiv_id":"2102.08240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.08240","snapshot_observed_at":"2026-08-07T15:20:10.863806Z","title":"SDSS-IV MaNGA: Blueberry Candidates Associated with LSB Galaxies $-$ Merger or Tidal Dwarf Systems ?","venue":"astro-ph.GA","work_id":"cf33d489-926d-485a-a44c-6603ae0230d5","year":2021},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.175618Z"},"links":{"cited_paper":"/paper/2102.08240","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:f23b99c5c7f658816714c9297bbc53f608c5ce3aae1b3fd77b0ed18c5d9614dc","observation_id":"7ce1941d-59ea-4963-9db1-a1d6a5018a53","resolution":{"observed_at":"2026-08-07T15:20:10.923120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:12.096937Z","title":null,"venue":null,"work_id":"933a0092-68fc-4c5c-a1c8-5ea851edb93d","year":2023},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.274586Z"},"links":{"citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:26df19df40c4f91c1ca55d068e97a33c6fa5a3c23a81a3132383d0caee3f417d","observation_id":"c25df258-6459-42bb-a4d8-67771b64f6d7","resolution":{"observed_at":"2026-08-07T15:20:12.163504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:11.933296Z","title":null,"venue":null,"work_id":"822e7a9d-9219-472e-908d-9b0dbf73bc22","year":2022},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.358873Z"},"links":{"citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:829bc77782088eabf0e481c6cef6aa193ed03c731ce8d563b5215c5ffccc269c","observation_id":"9798801e-0b2d-4a1b-ae91-8fd251924c60","resolution":{"observed_at":"2026-08-07T15:20:12.027414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:20:11.728347Z","title":null,"venue":null,"work_id":"931d7d02-5d17-4347-b629-4be35ad4b844","year":2018},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.447404Z"},"links":{"citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:00662cc3f79e509b8592afb8b13a5113dd9674c453aead971606901c7fec4ba6","observation_id":"f9b12953-c867-4def-84ea-eed7fdc4ea09","resolution":{"observed_at":"2026-08-07T15:20:11.802487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-07-06T20:30:26.881629Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-08-07T15:20:10.552803Z","title":"Hybrid Group Relative Policy Optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.552803Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:8938a57356d80dfc7f2e71af0252b971ffb154550bfab6f7fd0f3d67a13d70b1","observation_id":"ae8c1636-467b-47d2-9de2-31f898d0f24a","resolution":{"observed_at":"2026-08-07T15:20:10.552803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11364","last_updated":"2020-12-24T18:22:03Z","snapshot_observed_at":"2026-08-05T20:18:33.953605Z","submitted_at":"2020-10-22T01:02:55Z","title":"Sample Efficient Reinforcement Learning with REINFORCE","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11364","snapshot_observed_at":"2026-08-07T15:20:10.646973Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.646973Z"},"links":{"cited_paper":"/paper/2010.11364","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:2cda56d01a24ffa083eda14a44d6a9a768cae582337df983b8c23e63c685f750","observation_id":"3649ef8e-7d34-47fa-97f8-e11134e226e0","resolution":{"observed_at":"2026-08-07T15:20:10.646973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:20:10.726696Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:10.726696Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.15514"},"observation_digest":"sha256:d5390d6b24f95135bbaf5b2803e7d5f1477259fc42257384b1ab150dffd1ce81","observation_id":"7da76dcc-800e-408d-a769-d90a48d4f8bf","resolution":{"observed_at":"2026-08-07T15:20:10.726696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15514","last_updated":"2025-05-21T13:38:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:13:59.589795Z","submitted_at":"2025-05-21T13:38:45Z","title":"AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2505.15514."}