{"as_of":"2026-08-11T19:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4e08aba15cf55ee450612cb15e073c4c6883024eb5f05da737822be5017379d","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:34:16.916502Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28077/citation-record","integrity":"/paper/2607.28077/integrity","json":"/paper/2607.28077/citation-record.json","paper":"/paper/2607.28077"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-31T18:34:16.344258Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.344258Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:7664aedb50cf35f0c30a31a075f961fa21bd389d81d6b91b5e495e6c272d8536","observation_id":"ee94d858-5421-4682-82c3-a23559e4b9df","resolution":{"observed_at":"2026-07-31T18:34:16.344258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-31T18:34:16.348704Z","title":"arXiv preprint arXiv:2506.14245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.348704Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:0a1c63a209a783dd612395184329691738435deac66416569a08f667106ac438","observation_id":"7df2fb86-6cf9-48a0-be5c-c82780243a82","resolution":{"observed_at":"2026-07-31T18:34:16.348704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-07-31T18:34:16.352742Z","title":"arXiv preprint arXiv:2502.14768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.352742Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:ecc2d00b4d97426ce3be70de479048bc6deace7d8fd9e174c51e2baa462e32a0","observation_id":"a32c7b37-bee2-4c78-b8b6-24cef68e4dd4","resolution":{"observed_at":"2026-07-31T18:34:16.352742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.356595Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.356595Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:12b4df4e2679681f2e717dea3b782a140817e1f27c4dde96f57ebe73f9e38bb4","observation_id":"6c9463d0-7674-4b14-a9dd-f3bc26f16570","resolution":{"observed_at":"2026-07-31T18:34:16.356595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-31T18:34:16.360171Z","title":"arXiv preprint arXiv:2211.14275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.360171Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:0fae1d76d4098dd1f316e61c606a13b69b67c1aaad68f2fb4a9a5f6e76a656ca","observation_id":"14aee6da-2da9-4fad-91bb-3113ae3993e0","resolution":{"observed_at":"2026-07-31T18:34:16.360171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.363889Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.363889Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:ef3630eed73732dec003e759c2fb9784758437f8318cd1863c455f90a8b17809","observation_id":"1c56aa36-1193-47d7-a31f-bd1ee28bc587","resolution":{"observed_at":"2026-07-31T18:34:16.363889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.367599Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.367599Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:68cc014589f87be3ec314df26672e8fc6adf519734eba782b128b9837988f365","observation_id":"d84a5a00-0ef7-40d7-b9ed-d1377835d834","resolution":{"observed_at":"2026-07-31T18:34:16.367599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-31T18:34:16.370624Z","title":"5: Scaling reinforcement learning with llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.370624Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:e1292b76f08ba6e73271010ad4d2a2ea84570b6f79465a3b1585a2e529df64a0","observation_id":"9372ce85-4062-47f9-95b9-5cf3c9ee8cf9","resolution":{"observed_at":"2026-07-31T18:34:16.370624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.374288Z","title":"arXiv preprint arXiv:2503.17287 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.374288Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:e28860b70690e15b7ce8b3e00b4283a6dad0e801778340b40d5e5f892bca756a","observation_id":"0eb60f74-2525-4ca9-8c0b-e77632b6d78e","resolution":{"observed_at":"2026-07-31T18:34:16.374288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.377439Z","title":"arXiv preprint arXiv:2506.06632 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.377439Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:53b27f8f81c47a1fb193d8187bb376732efef79008a9639116459c1f089cdd1f","observation_id":"ca37b690-4ceb-4e53-ae49-edde598012af","resolution":{"observed_at":"2026-07-31T18:34:16.377439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.380404Z","title":"Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.380404Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:e47ba3514df3f87eb9eff5f6083325146e6b90eeb953c0a24ae22d77b2905b99","observation_id":"0a8a76b7-c856-4144-b28d-37faf4bdbd3d","resolution":{"observed_at":"2026-07-31T18:34:16.380404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.383443Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.383443Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:c31822e81e27ba1e2cdd6905206ca20f516abc721a9db7602d58ac65aad4f424","observation_id":"289a2a56-fe04-43ac-b275-5f84b15ad33f","resolution":{"observed_at":"2026-07-31T18:34:16.383443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.386473Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.386473Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:88f73fdd53d8b24eb10742a0f8534ce24fbd8b6ea6b5e161712019819fac4d5e","observation_id":"8ee3c5da-a7a6-4847-908b-478d56ff2296","resolution":{"observed_at":"2026-07-31T18:34:16.386473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.389401Z","title":"arXiv preprint arXiv:2506.09016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.389401Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:e0f27fae044d3a653a6bd940e4c8e89e60b61804b07f5023668878f0139f7943","observation_id":"3c403dbf-6adb-4157-a540-59103f6e1808","resolution":{"observed_at":"2026-07-31T18:34:16.389401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.392462Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.392462Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:f46b923d9847c46f293bbbf1e28e727da644a83f3751b8eab797e23f82314586","observation_id":"fc198569-6ca4-40d5-8d9a-64be99f57b27","resolution":{"observed_at":"2026-07-31T18:34:16.392462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.395533Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.395533Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:7f0365a4e0d7d8ba80cafa1cf0cf343e2a5cf7e3bdc080266f6c28af48f02bfd","observation_id":"b52d8413-a148-45ad-ab34-72fe9ba1f020","resolution":{"observed_at":"2026-07-31T18:34:16.395533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.399843Z","title":"arXiv preprint arXiv:2510.01037 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.399843Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:34fc863d1d678b9be1a2ac3407a41b48c576a4f2b5f3a6cf70d25c7a7582af3e","observation_id":"40a690dd-a4ba-4986-a1de-837b16f685a2","resolution":{"observed_at":"2026-07-31T18:34:16.399843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.403482Z","title":"Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.403482Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:d1fe1388461dc86cd662848039604f2e92e0e75986e4501d41b6cb838fa55334","observation_id":"beaf8e34-ed80-4f40-b8ec-d0e3c150a4e9","resolution":{"observed_at":"2026-07-31T18:34:16.403482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.406952Z","title":"arXiv preprint arXiv:2603.10887 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.406952Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:14d35d97ec7b2853d28a3e99804dad37dcac34ab0b148acd5eddea582a398bdd","observation_id":"7664759a-5aad-40e4-ac54-d5d99cf95034","resolution":{"observed_at":"2026-07-31T18:34:16.406952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.410463Z","title":"arXiv preprint arXiv:2505.14970 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.410463Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:3610ddb55d272707930fafc369fba1d618e3494b681c5543dde43da4f0ef71e5","observation_id":"e7859ec3-bd5e-4fa9-b6e5-85bd83eb83d5","resolution":{"observed_at":"2026-07-31T18:34:16.410463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19208","last_updated":"2026-04-23T16:56:38Z","snapshot_observed_at":"2026-07-06T22:46:40.118923Z","submitted_at":"2026-02-22T14:38:24Z","title":"How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.19208","snapshot_observed_at":"2026-07-31T18:34:16.414029Z","title":"arXiv preprint arXiv:2602.19208 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.414029Z"},"links":{"cited_paper":"/paper/2602.19208","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:5fc7d910557dd7f571bfbb3f21ce64c484eb63a3de7fc1e48dee6636221b98d8","observation_id":"219ee3bd-66fd-4a6e-b818-f9acd1b64784","resolution":{"observed_at":"2026-07-31T18:34:16.414029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-07T16:07:46.182926Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-07-31T18:34:16.418758Z","title":"arXiv preprint arXiv:2504.05520 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.418758Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:1cc24d4146f71052ed41709e76a585181c4765d1aa69c690fa8cc37d98a5e2c8","observation_id":"7feb79b7-381a-45b2-a2b2-74882e15702d","resolution":{"observed_at":"2026-07-31T18:34:16.418758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.424440Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.424440Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:b808613837650d538de2178092792b38af0a6ddc5ef73f40d5580f2898661ca5","observation_id":"86114a98-e6c7-46ad-a1dd-f63dee62c9d0","resolution":{"observed_at":"2026-07-31T18:34:16.424440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.435036Z","title":"arXiv preprint arXiv:2510.01135 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.435036Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:05be65ab53fa9f85148114d87b7c067e9312e5e3424a2995deb3d79b061aeca2","observation_id":"e0156dd9-cc2e-4105-80e1-e627ba5dc0ad","resolution":{"observed_at":"2026-07-31T18:34:16.435036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-07-31T18:34:16.443920Z","title":"arXiv preprint arXiv:2504.13818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.443920Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:bc17f6bedc24a08b4892cdf6770095a5cba37bbd240ff67763b59ffc5c1a9321","observation_id":"4780e41a-2fbe-47f2-9259-e700ea27a6f8","resolution":{"observed_at":"2026-07-31T18:34:16.443920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.451751Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.451751Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:5b5eb5a832b7208768063fc6ec6507669f05dcfbec0ac676c68e69dd3ebda0b0","observation_id":"8b97658a-80f3-4799-b633-69a077bdf0c0","resolution":{"observed_at":"2026-07-31T18:34:16.451751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.459350Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.459350Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:d3bfdc29215b0e6c9ae7c9e4014670113e9317142a83e97b538f194110a83488","observation_id":"80513b2a-6e96-44af-8c9f-329befdacf6f","resolution":{"observed_at":"2026-07-31T18:34:16.459350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.477161Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.477161Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:10b4ce577412e48656c9879a8cde5ec097fd2eea1e6d25e59cf2645adeabef67","observation_id":"384493e4-dca9-485f-8079-2331ece1a582","resolution":{"observed_at":"2026-07-31T18:34:16.477161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T18:34:16.485434Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.485434Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:320b6cd2e8d0606d3b560425f44b38e826ccc1fbab7ee5c256625cb3eceb6bc7","observation_id":"e1a1c7b2-bb42-4c53-b45f-65048bdfc867","resolution":{"observed_at":"2026-07-31T18:34:16.485434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T18:34:16.498285Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.498285Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:aea10045e5203d5765195db231fc4b395848091cb6261ee502341b1ee76e6a59","observation_id":"56f891fd-6e39-4461-a27f-7c11a11c6262","resolution":{"observed_at":"2026-07-31T18:34:16.498285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-31T18:34:16.506774Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.506774Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:0c93924c9ad95e10a2b86d83dc1d4ba51462d29689e78357a7297a8a5c0548bb","observation_id":"47b79656-782f-4d0a-8482-fdd822ed018b","resolution":{"observed_at":"2026-07-31T18:34:16.506774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-31T18:34:16.516029Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.516029Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:dc7307932898659416f2bc7a25dba7c01af328e83b0b672e679f7b583578ae69","observation_id":"8b18bc8a-04e0-40d8-90fe-cfa90cecffcf","resolution":{"observed_at":"2026-07-31T18:34:16.516029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-31T18:34:16.525444Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.525444Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:347d74d38d4d4d6ad015b4e4bc290c1435bd04d235344858704e553468a937b5","observation_id":"c795dfb8-050d-491c-b845-83dfe8e78fed","resolution":{"observed_at":"2026-07-31T18:34:16.525444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-07-31T18:34:16.534961Z","title":"5-coder technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.534961Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:de01f71a85b53f7c3e5e6445d2bdc4ef3f3253861bf057dd8adb6910e26b4adf","observation_id":"445ec05d-b607-4226-8c34-ea1472caefe7","resolution":{"observed_at":"2026-07-31T18:34:16.534961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-31T18:34:16.544380Z","title":"arXiv preprint arXiv:2409.12122 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.544380Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:fe9fc9a62c8e410e3768c13b6d3bfb82c68b3dfd4886e45807be831ee417be9b","observation_id":"c393f9dd-d3d5-4d12-8522-52f066401895","resolution":{"observed_at":"2026-07-31T18:34:16.544380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-31T18:34:16.553565Z","title":"arXiv preprint arXiv:2407.10671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.553565Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:491d2ffb156e09252efcb4ccbd3baeee15c36763d9becab60c36be3a3ba15498","observation_id":"4b6df2c4-0c3e-4557-b79e-f097d6227cf0","resolution":{"observed_at":"2026-07-31T18:34:16.553565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.562590Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.562590Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:35ad7b4b0ebb6bcbd05327f3bbf26c6937cf614daa485e9c71dfadee58be970f","observation_id":"8d89896b-5cee-4170-8ded-6ee10197303b","resolution":{"observed_at":"2026-07-31T18:34:16.562590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.572044Z","title":"Proceedings of the 29th symposium on operating systems principles , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.572044Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:2ed2df243229b6d3caee6bb8d1f4845d59eedaf1ae20494a62c817f24fdd2b25","observation_id":"d5d7ce2d-c7b0-4319-a4af-eb6a78e456a0","resolution":{"observed_at":"2026-07-31T18:34:16.572044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-31T18:34:16.581107Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.581107Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:84e26924adb395939e3f9a6e72b6fe61a779c1668017672302f3d181fd2a562f","observation_id":"7a2a8dc4-e919-4e6d-b89b-6a02fa74e4af","resolution":{"observed_at":"2026-07-31T18:34:16.581107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.590387Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.590387Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:5cccc4e13f3836e9a4469aea189ac836114df9e6fb7c352246f5dfb35eb13698","observation_id":"89006e4d-2fee-42f2-8c76-7eb7a2fc09a3","resolution":{"observed_at":"2026-07-31T18:34:16.590387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.599943Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.599943Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:b1ab8887719e9a09f22c110acdc54d146781016465bca6af95089dc02258f3e8","observation_id":"ee8b2bc1-946f-4e64-83e3-cfecdb9b6b66","resolution":{"observed_at":"2026-07-31T18:34:16.599943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.608955Z","title":"Hugging Face repository , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.608955Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:9161fae7b43db8dec24fb3b11c3a863e57558c33f4daf6c69f3d9ab3107dd116","observation_id":"bb76a247-688f-4957-9cb6-daf45fedd8fc","resolution":{"observed_at":"2026-07-31T18:34:16.608955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.619391Z","title":"arXiv preprint arXiv:2509.10625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.619391Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:67f2a8059d60eb0e040666d1c3f9f4a5d45a21c92282f433689283d55a873ce8","observation_id":"12485ec5-04ea-4473-881a-ebc797ba9586","resolution":{"observed_at":"2026-07-31T18:34:16.619391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-07-31T18:34:16.684880Z","title":"arXiv preprint arXiv:2406.01574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.684880Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:1f1275649c5aac31eb223818f2289fe1a0d3f95d96aa4d4fb414538e73eee568","observation_id":"17b49c01-62bb-4123-b649-65b6ef731d72","resolution":{"observed_at":"2026-07-31T18:34:16.684880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-31T18:34:16.749284Z","title":"arXiv:1803.05457v1 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.749284Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:bd30175b252497e83f46153334557bdd26971e48a5810a64b3a8c4d254a6b5b4","observation_id":"c168a90c-f079-443c-be8f-4ee72eb3c1e4","resolution":{"observed_at":"2026-07-31T18:34:16.749284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-31T18:34:16.817682Z","title":"arXiv preprint arXiv:2311.12022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.817682Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:9ee0f6c798e86ef35ad8ff9ee24e6d8ed0816f13d06c11191b7772a458428226","observation_id":"ea0de988-f89d-4450-b14f-dd4983d2e48f","resolution":{"observed_at":"2026-07-31T18:34:16.817682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.881976Z","title":"arXiv preprint arXiv:2509.24711 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.881976Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:a3a8302bc1fd1de60000791e0adb34df5dcedafb81c9c41d2bb669c72b4550d4","observation_id":"951ce4ef-14d2-45d6-927c-48d7333fb873","resolution":{"observed_at":"2026-07-31T18:34:16.881976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T18:34:16.916502Z","title":"arXiv preprint arXiv:2510.26374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.916502Z"},"links":{"citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:facaf0437815c9dabdb74523e4daf64d18f86dff2cddb3eeb50b63def828b1fd","observation_id":"8c023dc8-96d0-4b3e-bc8c-2727fa810f45","resolution":{"observed_at":"2026-07-31T18:34:16.916502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T13:54:08.782306Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.28077."}