Pith. sign in

Paper Citation Record · LEDGER

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 11 inbound Pith citation observations for arXiv:2509.09675.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.09675 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T18:53:02.820543Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-04T06:34:03.388597+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T10:36:23.165454Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T16:39:57.677897Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7c8d4574-d36e-4a66-9513-d4dc796d50d7 · outbound

This paper cites A Survey of Exploration Methods in Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models A Survey of Exploration Methods in Reinforcement Learning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.597599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.597599Z digest=sha256:d6eb251fd1d2af434c64f23a23a9a6931eaf9f911e311f30441614ba5580e8b3

Observation 7086f6d9-3732-48fc-84fc-8e693773f390 · outbound

This paper cites std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.820543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.820543Z digest=sha256:fe2b2ef42fb5f9542692e0d3eaabd2c9ec308b826c6260053805e8a23851af74

Observation 5aa8ec28-2077-4742-851a-d95c0b788c38 · outbound

This paper cites Qwen3-4B-Base-GRPO.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Qwen3-4B-Base-GRPO

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.813713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.813713Z digest=sha256:35120f95c240f45817d74c702b95602775488b72c95d12d69c6acda506dd2923

Observation e18ab364-7475-43b4-9f0e-aa8b67c2eb79 · outbound

This paper cites The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.638102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.638102Z digest=sha256:fc5790a6ddee20501b082f4d393dc49bbda2115c6d3a1d6d97dc8b8f992f44af

Observation 6747d781-40bb-453b-a586-a9ba2a630f5f · outbound

This paper cites Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.644861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.644861Z digest=sha256:e6755f96f9f74473fbbae2e68f1dc57cc5a2f875dc3f5ed66387227b40422c8d

Observation b7a85f9e-f9a8-4575-8593-467edb25e281 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.672697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.672697Z digest=sha256:a12c2c3505356b6e8b802c67ecd8378942fba6b013a635e9fc787b384d2c5e5c

Observation edf8c7ba-09fc-4dea-9987-691406fe9548 · outbound

This paper cites R-Zero: Self-Evolving Reasoning LLM from Zero Data.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models R-Zero: Self-Evolving Reasoning LLM from Zero Data

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.690293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.690293Z digest=sha256:525f9218a4d92b22ba4254266ad310b62f8b87a7730c20b3e3338172dfb8d448

Observation 82224b45-c9a0-41ba-b27b-66d47ad1791c · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.696442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.696442Z digest=sha256:e94b8140618673b841d547332e585ebfa2cc82233fce8758621575e16d1ae5f1

Observation a6d24b4f-2202-4ed8-8b6c-22d35406aa26 · outbound

This paper cites Continuous control with deep reinforcement learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Continuous control with deep reinforcement learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.713848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.713848Z digest=sha256:bdd8f36ad1fe840c74f19ebb3c32e9be1419488b49f8b02810ceaf1d0d5f9945

Observation 90686f68-f452-49b0-a015-954971bc96dc · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.719173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.719173Z digest=sha256:c0263cf42bbabacffd6c90ceea0bdaf0acef29553e08b1a2aee63479acd5c568

Observation c3fe07f1-8719-4bc0-9cad-4ef046aac618 · outbound

This paper cites Proximal Policy Optimization Algorithms.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Proximal Policy Optimization Algorithms

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.725388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.725388Z digest=sha256:f6ed550fa8e0ade4ad21d87dfff49f061960d80bb3b22c8b26583a51ebc60eca

Observation 0d2781dd-027f-4a65-a4c0-b329ef2326e0 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.730852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.730852Z digest=sha256:79008527ba1abb6805bed5005955f28da2b57ba1b596a1ec7f146fbe26f4b017

Observation 85d9f907-6cf2-486c-9306-6d340ed9c89a · outbound

This paper cites On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.736661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.736661Z digest=sha256:a24a0082a44d8ad0e6e5edba966f296cd6688cf7bd822694d01d572947653336

Observation 5f4aa9d9-897b-4962-9273-2271b2e68222 · outbound

This paper cites Thermometer: Towards Universal Calibration for Large Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Thermometer: Towards Universal Calibration for Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.742636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.742636Z digest=sha256:34bf0599c8249557fa326fa096bb21f50dd0d589e9dc38b07387b4e1f4f511f0

Observation 555c6c82-7c77-4038-a2f9-43400cb59813 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Solving math word problems with process- and outcome-based feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.748248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.748248Z digest=sha256:ae6129e16d957720ceb1ab11ed198c06d08295b7ca475128b2874fa628880cb1

Observation f22aacd1-a65f-4627-9d38-08d962735cec · outbound

This paper cites LiteSearch: Efficacious Tree Search for LLM.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models LiteSearch: Efficacious Tree Search for LLM

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.763705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.763705Z digest=sha256:0280b22fe2eb2f3f4298a3a1ac694ccf9b9f6412ed447a75664330ecfe13c5fb

Observation beefff04-48de-4cf9-b381-03c75111e970 · outbound

This paper cites Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.770333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.770333Z digest=sha256:7e1e656412d5a6521938a28f0b3bd96669a02e7c8b98eb1978a2a9cc55b65468

Observation c00dd1be-6d63-497a-aaf2-83d01e19e1ec · outbound

This paper cites Qwen3 Technical Report.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Qwen3 Technical Report

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.782542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.782542Z digest=sha256:247d7a2b05e784bef5494812e53c3b38e50785f0e2684470571d67566d512ae6

Observation 14604fba-6511-4875-b9b9-6e734e0d09cb · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.789262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.789262Z digest=sha256:943c5be6b64f26f6dd21999c1588c3b836cd1ebab86de9032080ba1cb854f355

Observation 785be2f1-8e1f-4b8f-86da-ff8b432162eb · outbound

This paper cites VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.795969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.795969Z digest=sha256:2162eeae1d6659627c504f8a23d7033c7c15a6b5435d9e5e3a231e8b2e23c960

Observation 0f693e32-c32b-4e35-8cc7-c3c537d19128 · outbound

This paper cites One Token to Fool LLM-as-a-Judge.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models One Token to Fool LLM-as-a-Judge

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.802208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.802208Z digest=sha256:3413daf1d6b95ab1cc1416160b71fc19e7d1ff39b86238fa8cd2e752aa2eced9

Observation 832c0674-f33c-4253-8d81-84f819a15d64 · outbound

This paper cites Learning to Reason via Mixture-of-Thought for Logical Reasoning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Learning to Reason via Mixture-of-Thought for Logical Reasoning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.808040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.808040Z digest=sha256:212f812fc200900fdc1cc4841ce6916bc8245824048881bfea22e15a175c820c

Observation 398b7170-af66-43e5-b8c6-f39c12d228aa · outbound

This paper cites Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training

Reference 1997

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.654971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.654971Z digest=sha256:b22288123b8afda61c0766c762b6a881e9028bbb9154c8c91532e914b4df224c

Observation b36915be-0427-4923-9bf1-971eaa09ee47 · outbound

This paper cites Self-Rewarding Vision-Language Model via Reasoning Decomposition.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Self-Rewarding Vision-Language Model via Reasoning Decomposition

Reference 2010

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.707977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.707977Z digest=sha256:f7055bb0f3779c1a060621b9357925cd51fd22f8b6033fa319915fdd713662de

Observation d9bacd8f-e76d-40d2-82f6-9ca30d510465 · outbound

This paper cites Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.666926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.666926Z digest=sha256:56bd17a8873e0ef21246cc92d9e43e4ab14fabfc49b8280c9bbe74d6c538e343

Observation 1c617351-2487-4a29-9d57-4246570be9c3 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.702231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.702231Z digest=sha256:9f69edf0ba4d1a0274c7fc0ebd84df42f8a45641dd13bdeb5c91618585d16012

Observation 12a00344-c489-4e71-83da-94b86ecbb9da · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.684631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.684631Z digest=sha256:ebba14486a2c6385bca4322f208802ded77527c4f0e373309c3174cd6f9aeb3c

Observation 5d9c5d8f-b005-415a-a257-49ea048cacfc · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Training Verifiers to Solve Math Word Problems

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.630026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.630026Z digest=sha256:bc882162a1a041d6e2b3b9debca426df4db5466038a31a10753e6112c18d4625

Observation 2fe00bae-31bc-4acd-938e-f62307b1658f · outbound

This paper cites Supervising the search process produces reliable and generalizable information-seeking agents.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Supervising the search process produces reliable and generalizable information-seeking agents

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.776951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.776951Z digest=sha256:d61d5bd922026958b00446e134125f399eedac468f16fd2761f17fa95ba8d2e3

Observation f0ebcc62-be89-4ba5-b101-e6d25f04a06e · outbound

This paper cites Online Preference Alignment for Language Models via Count-based Exploration.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Online Preference Alignment for Language Models via Count-based Exploration

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.606163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.606163Z digest=sha256:7f67832e2a5d832be45dba96b0b448b16354f75d02cb48662169c0ec89547129

Observation 3cdec345-3fa4-4bd6-ba62-80192386feb1 · outbound

This paper cites Calibrating Large Language Models Using Their Generations Only.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Calibrating Large Language Models Using Their Generations Only

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.754686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.754686Z digest=sha256:85ffb94304d48882421fe733cfbbc29cf119e26e6cfee7510da696147503ac03

Observation c8f1606b-f184-41d0-b092-a942c03e5d23 · outbound

This paper cites Deep Think with Confidence.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Deep Think with Confidence

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.660976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.660976Z digest=sha256:1dfb0aa4069bf7ccc3e60628b7393e6aca17f446d8ae0e671d949ddfa5fd5438

Observation 7fce78d2-28a7-4bd5-b754-c5491bdec338 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.678938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.678938Z digest=sha256:8e50ed47aa92e321c85ab4f778f7b2c1396f17f9c463ffe1f501e747bf563165

Observation 5a58071c-5895-4ae0-ab48-1c5826335408 · outbound

This paper cites Exploration by Random Network Distillation.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Exploration by Random Network Distillation

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.613187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.613187Z digest=sha256:74d30975128bb0ae52b9e2aeb89db5dbc773401fad584340dadf64aa7c7a3f7e

Pith citing papers

Observation 09f464ea-0ad7-4475-8c3d-19cd3b1ec900 · inbound

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics cites this paper.

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T10:36:23.165454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T10:36:23.165454Z digest=sha256:9cf4b60525e25f478b28820251fabfb888b281b4b2e1b3e4ddf650f8acceb1b4

Observation 93ca5813-c903-41f5-8c9b-4dd664148796 · inbound

Calibration-Aware Policy Optimization for Reasoning LLMs cites this paper.

Calibration-Aware Policy Optimization for Reasoning LLMs CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:06:01.061297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-10T15:40:24.396851Z digest=sha256:ede3e8b227ff23313ff1a4bea221872faa6887a685d90b7a32959ec6a9728d67

Observation c50ad9dd-2bad-4881-a5e8-43369204a2e7 · inbound

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data cites this paper.

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-10T05:36:01.999728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-10T05:32:23.972335Z digest=sha256:31341a3b0a4574d608cbf329c50a4b57243b1337eb289cb1cda7e11aef44c484

Observation 45a82209-4970-43e8-9141-2cf073ebb7ec · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:11:28.843337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-07T07:00:32.206081Z digest=sha256:ecb0f3477ab8a65fcf9e85afd3e8eeb89ecfd4d1c2133456149dc5938c576135

Observation 368f6c5e-2403-4604-9882-89a8c77393e9 · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-20T23:49:14.899678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-20T23:47:53.282259Z digest=sha256:dfc7eb3888d9389cd767748677dd856d806857657435abb65f9ba0a2dbc22f17

Observation 236cf7f9-3abe-43d0-8427-5a59be816a68 · inbound

Reinforcing Multimodal Reasoning Against Visual Degradation cites this paper.

Reinforcing Multimodal Reasoning Against Visual Degradation CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:06:25.142345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-12T04:37:21.451146Z digest=sha256:b7790ddf25f47e0e16aae8746b814e75ce067eef0085aab079d817cc29a1536b

Observation 9d32ec0f-a3ba-43e5-bbd1-5de9823bc9c3 · inbound

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification cites this paper.

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:01:24.281809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-12T04:41:44.833354Z digest=sha256:fdc7c5e8a79494d70116a4434de87038f63494d6c02e6ebab84bdd014d4f8d66

Observation 3039b200-07d3-4b2c-a9be-e5fcab8a40e4 · inbound

Epistemic Uncertainty for Test-Time Discovery cites this paper.

Epistemic Uncertainty for Test-Time Discovery CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:57:06.101531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-13T01:52:41.192353Z digest=sha256:a1e508f06ab1880675af56628bb5733640e8978879a3e0353bd460954bded700

Observation 1358ee36-5a8f-4a5b-a9b9-66951295ece0 · inbound

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter cites this paper.

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-02T11:46:56.173296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-28T02:53:22.159132Z digest=sha256:dd035cc218c8a13ac251393bfc7a31a7e2039edcf70b5c60312262a51b10a229

Observation 92d15d31-edab-49ac-955e-6afb9bba302f · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.656115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:7dfc820ef86fb3d8ce2c2fe39bd180547d888a5bea91c45cdb7d6432c3148635

Observation 59aabf2b-ef39-4e89-967b-6d107da89b62 · inbound

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning cites this paper.

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-04T16:39:57.679442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-26T00:23:16.499175Z digest=sha256:1ca3e30a16e6da2022f75d6246ad274eb97b844692bbb71a76460977f25dbc6b