{"as_of":"2026-08-23T04:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c93155f1b7c5e68a88cc7af86e92bab504fd768e213c4131b8e21a0516cdcd2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":2,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":2,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:46:16.638153Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.02246","last_updated":"2022-05-03T08:21:55Z","snapshot_observed_at":"2026-08-16T17:09:29.734215Z","submitted_at":"2022-04-04T12:38:58Z","title":"Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02246","snapshot_observed_at":"2026-08-10T00:46:16.638153Z","title":"Continuously discovering novel strategies via reward-switching policy optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18093","last_updated":"2025-01-30T02:09:35Z","snapshot_observed_at":"2026-08-19T23:34:22.672359Z","submitted_at":"2025-01-30T02:09:35Z","title":"Reward Prediction Error Prioritisation in Experience Replay: The RPE-PER Method","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:16.638153Z"},"links":{"cited_paper":"/paper/2204.02246","citing_paper":"/paper/2501.18093"},"observation_digest":"sha256:8585f2c79c51557a4f89292e0f9a092adf351f70ef82e4a7102b3f0660e3c642","observation_id":"6a105918-acd3-4fbf-aed2-097036a68bd8","resolution":{"observed_at":"2026-08-10T00:46:16.638153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02246","last_updated":"2022-05-03T08:21:55Z","snapshot_observed_at":"2026-08-16T17:09:29.734215Z","submitted_at":"2022-04-04T12:38:58Z","title":"Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization","version":3},"cited_work":{"arxiv_id":"2204.02246","doi":"10.48550/arxiv.2204.02246","metadata_source":"arxiv_reference","pith_arxiv_id":"2204.02246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuously","venue":"arXiv (Cornell University)","work_id":"450441a2-6840-4666-9d78-4a4e4c204b2e","year":null},"citing_paper":{"arxiv_id":"2605.12655","last_updated":"2026-06-10T15:03:44Z","snapshot_observed_at":"2026-08-14T11:53:55.360220Z","submitted_at":"2026-05-12T19:01:16Z","title":"Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:35.277901Z"},"links":{"cited_paper":"/paper/2204.02246","citing_paper":"/paper/2605.12655"},"observation_digest":"sha256:0d0ac413655e42a7f365500c0308f960de4a6d7e23b5b44d01f248e82a4cc0be","observation_id":"b62eeae8-63be-42a8-8379-3b568772b613","resolution":{"observed_at":"2026-06-30T22:15:05.811146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2204.02246/citation-record","integrity":"/paper/2204.02246/integrity","json":"/paper/2204.02246/citation-record.json","paper":"/paper/2204.02246"},"outbound":[],"paper":{"arxiv_id":"2204.02246","last_updated":"2022-05-03T08:21:55Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:09:29.734215Z","submitted_at":"2022-04-04T12:38:58Z","title":"Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 2 inbound Pith citation observations for arXiv:2204.02246."}