{"as_of":"2026-08-06T21:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b063a5aae97c8f92fc47440aa12c92fc5b62651b0b8f1572b6f50c27a2172d35","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:23:08.113394Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:54:44.275053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T23:04:01.364747Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"cited_work":{"arxiv_id":"2602.08499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08499","snapshot_observed_at":"2026-06-29T23:04:01.364747Z","title":"Contextual rollout bandits for reinforcement learning with verifiable rewards","venue":"cs.LG","work_id":"e2f7ae66-c7c9-44db-a4fb-919a5394e8d0","year":2026},"citing_paper":{"arxiv_id":"2604.00860","last_updated":"2026-07-07T13:24:35Z","snapshot_observed_at":"2026-08-04T03:47:42.752894Z","submitted_at":"2026-04-01T13:10:20Z","title":"Policy Improvement Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T22:47:05.132020Z"},"links":{"cited_paper":"/paper/2602.08499","citing_paper":"/paper/2604.00860"},"observation_digest":"sha256:53cb1196b13f5b1732d3b8b379f31e563a6807f0e30f7c15f736145914de9a81","observation_id":"e3588103-6d95-4d47-8f70-046e88853374","resolution":{"observed_at":"2026-05-26T03:04:11.606338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"cited_work":{"arxiv_id":"2602.08499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08499","snapshot_observed_at":"2026-06-29T23:04:01.364747Z","title":"Contextual rollout bandits for reinforcement learning with verifiable rewards","venue":"cs.LG","work_id":"e2f7ae66-c7c9-44db-a4fb-919a5394e8d0","year":2026},"citing_paper":{"arxiv_id":"2605.25864","last_updated":"2026-05-25T13:55:12Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T13:55:12Z","title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:46.313028Z"},"links":{"cited_paper":"/paper/2602.08499","citing_paper":"/paper/2605.25864"},"observation_digest":"sha256:218f1b739b3f944c1458452897de9bfc0c5a22c4c62ad47d5163722816cd1ffe","observation_id":"427e1e51-9686-4af8-893e-8b5616a06d2d","resolution":{"observed_at":"2026-06-29T23:04:01.366182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"cited_work":{"arxiv_id":"2602.08499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08499","snapshot_observed_at":"2026-06-29T23:04:01.364747Z","title":"Contextual rollout bandits for reinforcement learning with verifiable rewards","venue":"cs.LG","work_id":"e2f7ae66-c7c9-44db-a4fb-919a5394e8d0","year":2026},"citing_paper":{"arxiv_id":"2606.00133","last_updated":"2026-05-28T21:23:24Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-28T21:23:24Z","title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","version":1},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:23.776293Z"},"links":{"cited_paper":"/paper/2602.08499","citing_paper":"/paper/2606.00133"},"observation_digest":"sha256:cdb4583af200941d860dea5fc7df021d2fb7146f45e946bdf73559858148d95b","observation_id":"55a80e4a-cd6d-4993-bf4f-5eb67519a838","resolution":{"observed_at":"2026-06-29T08:43:15.723332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08499","snapshot_observed_at":"2026-08-04T21:54:44.275053Z","title":"arXiv preprint arXiv:2602.08499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-06T21:26:52.700262Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.275053Z"},"links":{"cited_paper":"/paper/2602.08499","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:d72bc4f3fab9eea054d1237c7ec1810529817e3966fb84e0f956f3fb4aad7c76","observation_id":"1760ee1a-2a76-4fac-b3b8-d602362fe35f","resolution":{"observed_at":"2026-08-04T21:54:44.275053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.08499/citation-record","integrity":"/paper/2602.08499/integrity","json":"/paper/2602.08499/citation-record.json","paper":"/paper/2602.08499"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:23:07.732084Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:23:07.732084Z"},"links":{"citing_paper":"/paper/2602.08499"},"observation_digest":"sha256:06b7d9e18e58e459848e5331633bd1167627bee16ec92b65120cfa8d4bb06ccc","observation_id":"49629e8f-5cea-4869-863b-130081a16299","resolution":{"observed_at":"2026-08-03T03:23:07.732084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:23:07.866263Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:23:07.866263Z"},"links":{"citing_paper":"/paper/2602.08499"},"observation_digest":"sha256:559813c5ca9a19d1b7b26f98282d7dbfdac8956147045347f15c63f93886aadc","observation_id":"584d726f-0bda-445f-a56b-29751b511513","resolution":{"observed_at":"2026-08-03T03:23:07.866263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:23:07.981528Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:23:07.981528Z"},"links":{"citing_paper":"/paper/2602.08499"},"observation_digest":"sha256:2e2d164005063aa96f8e3e7ec403505bd44522409ef537755e520dcce273c902","observation_id":"053d8066-c87f-4a15-a22d-8e998a294c37","resolution":{"observed_at":"2026-08-03T03:23:07.981528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:23:08.113394Z","title":"The largestnis 1533","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:23:08.113394Z"},"links":{"citing_paper":"/paper/2602.08499"},"observation_digest":"sha256:15c1de85cc0fb36e958b5d520465014abaaff4edec66f572e558643e26006665","observation_id":"8929999b-17ca-42a7-9dea-fea12315fa84","resolution":{"observed_at":"2026-08-03T03:23:08.113394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:23:07.634282Z","title":"11 Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:23:07.634282Z"},"links":{"citing_paper":"/paper/2602.08499"},"observation_digest":"sha256:4b1c69a5ec4e5eb3c41115c0139ce3fbe952745f74fac5065b93534a27c55282","observation_id":"4e194c70-e8a8-4203-8667-81903fef3168","resolution":{"observed_at":"2026-08-03T03:23:07.634282Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 5 of 5 outbound references and 4 inbound Pith citation observations for arXiv:2602.08499."}