{"as_of":"2026-08-11T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9a0a4bde361b141f3da38ede693d8ab7dc396a96a4f2e93595ae3bb60a5fa35","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:39:41.941604Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16206/citation-record","integrity":"/paper/2607.16206/integrity","json":"/paper/2607.16206/citation-record.json","paper":"/paper/2607.16206"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T14:39:41.315946Z","title":"arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.315946Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:aa0c6055a62c525d9b33eb25d42611bda5f1eafbdda94d5e1b513651cd950e58","observation_id":"4e5d2703-1aa4-4b6c-bef6-852ff8dd2f3b","resolution":{"observed_at":"2026-08-02T14:39:41.315946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.357065Z","title":"Advances in Neural Information Processing Systems, 36 (2023) PPO-HSC: Exploratory RL via Policy Coverage Optimization 13","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.357065Z"},"links":{"citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:673eab2f7def5e0b8654d914ab7379668b23a53cd029f27f554f70c9dc6cd918","observation_id":"78db689e-a9b8-4d48-8a96-3b0e42ec475e","resolution":{"observed_at":"2026-08-02T14:39:41.357065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T14:39:41.442301Z","title":"arXiv:2506.14245 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.442301Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:7732e3d6a700e3b9255dc70d8575caeb7b238124830501e09af36db5db376abb","observation_id":"0f0e6076-2c99-483a-921b-6606026c0a5e","resolution":{"observed_at":"2026-08-02T14:39:41.442301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.546403Z","title":"Advances in Neural Information Processing Systems, 29 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.546403Z"},"links":{"citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:da249da037043ef634452a0b9821eff2f1d48b5a558cbe5e15bcad744a78ebd4","observation_id":"e3d26c6a-edaf-419d-8803-3a1e3e894c4e","resolution":{"observed_at":"2026-08-02T14:39:41.546403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.606926Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.606926Z"},"links":{"citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:2507a6d87244b5dba920fd58df8e51826ddc3cb56325b38aa6dafe57f7587b6c","observation_id":"72246951-7bf9-4f5e-9c37-4e4017687e27","resolution":{"observed_at":"2026-08-02T14:39:41.606926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.687986Z","title":"Connection Science, 3(3), 241-268 (1991)","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.687986Z"},"links":{"citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:1e986129d560963a830fba2d7af50a88d82038e271a12214d38bc88638e6afb8","observation_id":"ae3c72eb-87a7-43e9-95e9-bae7cce5a9cb","resolution":{"observed_at":"2026-08-02T14:39:41.687986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.774153Z","title":"Frontiers in Robotics and AI, 3, 40 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.774153Z"},"links":{"citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:3555f6be63f97c3ed87b4419fc797482d5ea62b3d15e8a093174f7a096d0e1a3","observation_id":"079e982c-2674-4b67-8236-be916da7b3f8","resolution":{"observed_at":"2026-08-02T14:39:41.774153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.863188Z","title":"O.: Abandoning Objectives: Evolution Through the Search for Novelty Alone","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.863188Z"},"links":{"citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:d022e0fb11cbd3ba1b45705ed47b84e74808c0b4195c5e4064301435673c0525","observation_id":"e19e80e0-c24c-4057-b940-d802b63f77a1","resolution":{"observed_at":"2026-08-02T14:39:41.863188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.04909","last_updated":"2015-04-20T01:17:00Z","snapshot_observed_at":"2026-07-06T04:15:24.342522Z","submitted_at":"2015-04-20T01:17:00Z","title":"Illuminating search spaces by mapping elites","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.04909","snapshot_observed_at":"2026-08-02T14:39:41.941604Z","title":"B., Clune, J.: Illuminating Search Spaces by Mapping Elites","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.941604Z"},"links":{"cited_paper":"/paper/1504.04909","citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:68efd18ae71a12202b0baffd407eb2b4931ee6e02486a3d8209139ad43a12b2b","observation_id":"69e4a543-aa9d-45b7-9829-c43d79582777","resolution":{"observed_at":"2026-08-02T14:39:41.941604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 0 inbound Pith citation observations for arXiv:2607.16206."}