{"as_of":"2026-08-12T14:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6525c566c906a9a47c922bff612a00bde41d7e35db70b4eed45b56e216d45dd","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:56:51.117654Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.12703/citation-record","integrity":"/paper/2501.12703/integrity","json":"/paper/2501.12703/citation-record.json","paper":"/paper/2501.12703"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.767087Z","title":"Deep Reinforce- ment Learning for Robotic Manipulation—The State of the Art,","venue":null,"work_id":"9b5b63a4-5567-4b80-8b44-7553158c895b","year":2018},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:50.971230Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:4c48e8929bf1be16ca81e9464a5de14f9172712342367224d6e1eb08f69ff8a6","observation_id":"851083a3-8cf4-4036-a67c-4e29d48ebf7c","resolution":{"observed_at":"2026-08-10T16:56:51.771394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.751889Z","title":"Trust Region Policy Optimization,","venue":null,"work_id":"d23aeb15-f2c4-484f-9e2e-c063ebe31eca","year":2015},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:50.994051Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:dd1e49ceb36a84feb78a84b1af3dde39fb7a060c7e765efe4f90eeaef06e22dd","observation_id":"fd00e4a1-9261-401e-8ac9-afcbafc6761a","resolution":{"observed_at":"2026-08-10T16:56:51.756353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T16:56:50.989893Z","title":"Available: http://arxiv.org/abs/1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:50.989893Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:acb2bd7c162142f0dcb82446716f9e64de95125a4b8c0e60987dd4d60038056a","observation_id":"a2b5a92c-33fd-4cda-b83c-189239dfae9c","resolution":{"observed_at":"2026-08-10T16:56:50.989893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-10T16:56:51.004249Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.004249Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:f0d45f7056ea824e42bfa86f713f3b59ffbee880b9dbc00305d73dc76c23719e","observation_id":"53dc0fd6-3ec5-445f-83a7-88984a35e637","resolution":{"observed_at":"2026-08-10T16:56:51.004249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T16:56:50.998963Z","title":"Adam: A Method for Stochastic Optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:50.998963Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:b5b2edfe6b4b64721beaf2ee7d2998c9cc1e60c8fec1c3e8143663ff69edf028","observation_id":"d6c50502-6585-4964-a7e2-d8d07e4a37b2","resolution":{"observed_at":"2026-08-10T16:56:50.998963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.737988Z","title":"FIXAR: A Fixed-Point Deep Re- inforcement Learning Platform with Quantization-Aware Training and Adaptive Parallelism,","venue":null,"work_id":"6bf024e6-568d-4823-8f4f-f193311c7276","year":2021},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.015420Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:b5b60157f43988f4406fee73441c08da179a21add93527bc17a0ae03ab18b147","observation_id":"c80dd969-9d66-46f8-89a2-01d0cddfaf3c","resolution":{"observed_at":"2026-08-10T16:56:51.742467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01055","last_updated":"2022-11-14T01:42:10Z","snapshot_observed_at":"2026-07-06T08:26:26.249063Z","submitted_at":"2019-10-02T16:22:29Z","title":"QuaRL: Quantization for Fast and Environmentally Sustainable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01055","snapshot_observed_at":"2026-08-10T16:56:51.009947Z","title":"QuaRL: Quantization for Fast and Environmentally Sustainable Reinforcement Learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.009947Z"},"links":{"cited_paper":"/paper/1910.01055","citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:b878529dea37e513190f9f81d6405c9e187fe743acd3a9e41a1e8573ea647e86","observation_id":"370fcbf2-6990-4c08-9678-f851544824b3","resolution":{"observed_at":"2026-08-10T16:56:51.009947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.708594Z","title":"EnvPool: A Highly Parallel Reinforcement Learning En- vironment Execution Engine,","venue":null,"work_id":"4b03d022-e146-481b-8cb0-9fe774f38dad","year":2022},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.025503Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:d0d8b768177dedabcfcc2796dc8bdcb4bd8e46f56aaf416f852ddb0af3553867","observation_id":"f7fb7a99-274b-4858-96e1-152edea360ea","resolution":{"observed_at":"2026-08-10T16:56:51.714190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.724267Z","title":"Accelerating Proximal Policy Optimization on CPU-FPGA Heterogeneous Platforms,","venue":null,"work_id":"bfcda4bd-5c92-48c9-b9e4-1a7c66c7bb16","year":2020},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.020572Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:84a4f203cf5e60d65d3ad744ec38a09b0f2e011e690f88dd088a34f81c511a34","observation_id":"55aa3610-82b8-4d41-a3b8-acc07e81cc40","resolution":{"observed_at":"2026-08-10T16:56:51.728981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.677393Z","title":"GPU-Accelerated Robotic Simulation for Distributed Reinforcement Learning,","venue":null,"work_id":"7deb4009-a529-4522-8529-3b485b467a32","year":2018},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.034998Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:e2be69b87126806a04c817311f3342d89f436d501884bbc41471e787fbbe1ada","observation_id":"cbdc85e0-98e7-4158-ada6-9c843614d871","resolution":{"observed_at":"2026-08-10T16:56:51.682334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.693077Z","title":"Accelerating Reinforcement Learning through GPU Atari Emulation,","venue":null,"work_id":"035dfbd7-97ab-4147-8671-7114aaf67187","year":2020},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.030477Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:bb0710fbe4b16f93b9bb25c8b8cd631ddca81655ff3200dcfecae338a863909a","observation_id":"f716cda3-6545-4b38-b74f-da7f535c7f6d","resolution":{"observed_at":"2026-08-10T16:56:51.698095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.647861Z","title":null,"venue":null,"work_id":"79bde0e9-20fe-4e55-bc4f-7ef0d97f9839","year":1998},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.049387Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:46f25fc16db9ef09e732827092fab7d3c3ab368313c011d073b7cbbd20f007fd","observation_id":"b38a05ef-509b-443f-b3a2-95588fa65843","resolution":{"observed_at":"2026-08-10T16:56:51.652469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.662567Z","title":"Note on a Method for Calculating Corrected Sums of Squares and Products,","venue":null,"work_id":"e50624e5-416b-4fae-906e-67290c3d917a","year":null},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.039484Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:6fb35a43784cb34eb1ae39f75c6ece84f577bdb59a28f775e5225ce99c0d9dc5","observation_id":"0b0eaba1-278a-4cbb-b6aa-c24862367dbc","resolution":{"observed_at":"2026-08-10T16:56:51.667672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.600512Z","title":"(2018) Understanding Normalization of Advantage Function in PPO [Online]","venue":null,"work_id":"0c35c263-a8cb-4424-bddd-fc9db47768b3","year":2018},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.063554Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:a21f0ae9eb1999acb6a0d8c9466b76daf8ba2ee570198cbd1e5b8bb5e55fc39a","observation_id":"96ab6666-9ee0-4b7c-9951-0a6590e6b8af","resolution":{"observed_at":"2026-08-10T16:56:51.606759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.582540Z","title":null,"venue":null,"work_id":"153e4ad8-16c1-4b2a-9f08-2c49639030b2","year":2023},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.068212Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:7d7e99dcac561c93f0e4823b157da343b1ad620e9fe3e13ddf15a5a15f8948be","observation_id":"4400bab7-7e5d-4998-bc50-f3338952fc91","resolution":{"observed_at":"2026-08-10T16:56:51.587589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.631850Z","title":null,"venue":null,"work_id":"872ee51b-302d-4011-8ef2-3e741c821bea","year":2021},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.054097Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:5897f73265443550ad941dec723f1694a3fda72a1cdb009b4ce0839bcdbc0533","observation_id":"179541f6-90d1-4dbe-aa06-777520f4d671","resolution":{"observed_at":"2026-08-10T16:56:51.636925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.553283Z","title":"Revisiting Deep Learning Paral- lelism: Fine-Grained Inference Engine Utilizing Online Arithmetic,","venue":null,"work_id":"4bfc33cb-647f-4c34-b17c-7f7bc520ef68","year":2019},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.077437Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:fe8b89693990a58f2c198fa7f3fcd743f1199ace38bd47aa17aff3d6b138014e","observation_id":"3251f2e3-1dcd-48ee-b6c9-159998dde902","resolution":{"observed_at":"2026-08-10T16:56:51.557903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.535469Z","title":"Enabling Mixed-Timing NoCs for FPGAs: Reconfigurable Synthesizable Synchronization FIFOs,","venue":null,"work_id":"c1ee0184-fd22-432d-a27d-7dc23deaaee3","year":2021},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.081737Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:5e381972a53154830db6d40f756628f22cc06e174f25bb18e51b6c9d7299de16","observation_id":"701ae6d7-a28a-4dc8-81ed-d53969493647","resolution":{"observed_at":"2026-08-10T16:56:51.540618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.518574Z","title":"Reconfigurable Synthesizable Syn- chronization FIFOs,","venue":null,"work_id":"e20e0e34-3f5a-4324-838e-c80244f77760","year":2021},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.085769Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:a1cbcba3cb66ebe748ec95040d375eaf5283f220e7736a308100369e89c1e63c","observation_id":"51f16659-a3a6-4dad-a98a-4e167a2b5d37","resolution":{"observed_at":"2026-08-10T16:56:51.525269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.567643Z","title":"Safe Overclocking of Tightly Coupled CGRAs and Processor Arrays using Razor,","venue":null,"work_id":"d7368ad0-e500-47c0-9a07-cae14f5366a3","year":2013},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.072867Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:9d82d8356f74d8197b3dbc54c4084deeedcd70725e11d9c56dba112c318fb97a","observation_id":"8aaf4c8c-1f35-48f8-a33e-c841b30cbe3d","resolution":{"observed_at":"2026-08-10T16:56:51.572617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.482478Z","title":"High-Throughput Synthesizable Synchronization FI- FOs for Mixed-Timing NoCs,","venue":null,"work_id":"df81e1b2-7b10-48ae-a056-bd4595adac4a","year":2020},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.093537Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:67af95574968c2a9ce45816ac408720f0dcc611d48b3acc944ca246e0b01e295","observation_id":"2cf4b782-1809-47fa-846e-672adc3adb67","resolution":{"observed_at":"2026-08-10T16:56:51.488365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.459659Z","title":"Interleaved Architectures for High-Throughput Synthesizable Synchronization FIFOs,","venue":null,"work_id":"6c0635ea-f5d3-40fd-a7fe-e4dba65541a4","year":2017},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.099058Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:619b0ce840a4c58614479ddca8b5b9203d23dd308a49aaa6084b080d6421c96f","observation_id":"67226e91-8ae9-4118-8765-1702d5debd09","resolution":{"observed_at":"2026-08-10T16:56:51.464824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.442876Z","title":"Atalanta: A Bit is Worth a “Thousand","venue":null,"work_id":"a5cf117c-ff77-42ea-9831-4572e20032a1","year":2024},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.103856Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:cfbc63adbccf817708befe5ca2c6e87d3583c48ace1f03011f3681c10ae053ec","observation_id":"6703a6f9-c379-4be3-9295-5f438e3b8517","resolution":{"observed_at":"2026-08-10T16:56:51.448593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.500434Z","title":"Synthesizable Synchronization FIFOs Utilizing the Asynchronous Pulse-Based Handshake Protocol,","venue":null,"work_id":"e647180b-4f46-4f0f-8458-24224212315a","year":2020},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.089604Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:a20128e88d8f3f0b7f8533ae49ef84c0b718beff757641c26c3e09ff3a26bb40","observation_id":"a885b039-9f97-453a-8efe-d055e03434b6","resolution":{"observed_at":"2026-08-10T16:56:51.505668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.408865Z","title":"Boveda: Building an On-Chip Deep Learning Memory Hierarchy Brick by Brick,","venue":null,"work_id":"3d07206d-d5d7-451d-a9a8-ee18f96fb11a","year":2021},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.112660Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:d5f1bcb37d3b7c8521c6ff8495d004ef24be552aa1d88339258432386e445705","observation_id":"31363f23-6940-4a1b-9181-9ca4b59fa406","resolution":{"observed_at":"2026-08-10T16:56:51.415272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.426514Z","title":"Mokey: Enabling Narrow Fixed-Point Inference for Out-of-the-Box Floating-Point Transformer Models,","venue":null,"work_id":"5797b7b9-5830-4ab0-a0da-e2e602e47e87","year":2022},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.108343Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:fe28642c2fc0b02355f79b83d7f21dcc349b3b34d071b39249d9b23635b9a7c5","observation_id":"7fc6d1aa-d000-4ca5-8945-078d9b7bdb80","resolution":{"observed_at":"2026-08-10T16:56:51.431929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.392490Z","title":"Available: https://proceedings.mlsys.org/paper files/paper/ 2021/file/12a304a31e42dfefa21c82431e849124-Paper.pdf 9","venue":null,"work_id":"b7464b18-9b8e-40e8-ac33-1785b9249fbe","year":2021},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.117654Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:3e07ea029d95ba6850253a5be7ba6b12689b468cbe61ecfb8909ff83b1c4d02f","observation_id":"31dadffc-fdde-4cf5-8a32-e4db56796dcf","resolution":{"observed_at":"2026-08-10T16:56:51.397499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.616794Z","title":null,"venue":null,"work_id":"23432323-9df2-4ca9-987e-9a6942d00670","year":2024},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":485,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.059004Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:01de464da31016bc5166f99723e27d4d8088c82d6a15aa108e7a64f30d626c59","observation_id":"54985f18-abc4-4ad2-8b2b-272fb6748f7b","resolution":{"observed_at":"2026-08-10T16:56:51.621641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/1266577","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:56:51.300020Z","title":"Available: https://www.jstor.org/stable/1266577","venue":null,"work_id":"e9a3519f-7538-4629-9ff6-c5aead7bb5f0","year":null},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":1962,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:51.044063Z"},"links":{"citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:22383e8b992adc9dbd7fbb93e00adf61857fc0af8f8aaf96e023db4749de6a3d","observation_id":"1e9d03f2-3603-451b-93ba-60e62f257be1","resolution":{"observed_at":"2026-08-10T16:56:51.310916Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-10T16:56:50.980566Z","title":"Available: http://arxiv.org/abs/1712.01815","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T16:56:50.980566Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2501.12703"},"observation_digest":"sha256:f7bcd692c9a45812ee7fbf8842839fe41f50a4a9f9999f35f581761bdde948aa","observation_id":"f6ad1393-60cf-4f1d-bc29-dc0df14e6709","resolution":{"observed_at":"2026-08-10T16:56:50.980566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12703","last_updated":"2025-07-21T04:43:33Z","latest_version":2,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-10T16:50:44.883401Z","submitted_at":"2025-01-22T08:18:56Z","title":"HEPPO-GAE: Hardware-Efficient Proximal Policy Optimization with Generalized Advantage Estimation"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2501.12703."}