{"as_of":"2026-08-10T05:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7553dcf7b034af5dbd129e7853cd4b1135d114c07ca53d34a60bb5674d3433d1","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:23:54.829237Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:33:43.695859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.662689Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:e0a20c32bd116316f0339d1258483f054a213c8f0a023b11026455adf5abfa91","observation_id":"ccf703d3-489a-4cbe-adaf-5d000ca5b6bf","resolution":{"observed_at":"2026-05-21T13:14:10.971468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-08-03T03:33:43.695859Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:43.695859Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:58fc69476843277c3ffda72ce3955364898865616491181bf958b8c9806ed48d","observation_id":"09b23c32-fb30-4c1a-a096-9dbebe7a4b2b","resolution":{"observed_at":"2026-08-03T03:33:43.695859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2605.08283","last_updated":"2026-05-08T07:38:35Z","snapshot_observed_at":"2026-08-03T16:22:22.745568Z","submitted_at":"2026-05-08T07:38:35Z","title":"HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:42.836549Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2605.08283"},"observation_digest":"sha256:50ac7d25f71f4d458ff2789cd9ed13a71dedf4fbae992e242970998c4f458660","observation_id":"5c05e544-ae55-45ef-b807-6a1da0229726","resolution":{"observed_at":"2026-05-12T00:51:14.596330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-02T08:39:07.747479Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:1501149eca673e1cb1fca3051840f73ff429aab4f4f08654d7728fee038dbd89","observation_id":"f4f5a4c4-890c-4235-bb9b-38ae12da4741","resolution":{"observed_at":"2026-05-13T01:57:06.044731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:79738f7d5705769b13771dc80839271c6b81f664f3ad9d6d4fda72a5821cba12","observation_id":"efaff5c3-2482-45f9-8ded-02939fa1f10b","resolution":{"observed_at":"2026-07-03T20:38:56.101152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2606.20967","last_updated":"2026-06-18T22:07:39Z","snapshot_observed_at":"2026-08-06T11:06:05.462628Z","submitted_at":"2026-06-18T22:07:39Z","title":"Formalizing Task-Space Complexity for Zero-Shot Generalization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-26T17:28:55.356850Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2606.20967"},"observation_digest":"sha256:d2c9353731aa6ba3ea65a9cd424b27a5fe8ac0a9fcf8b9ba8daa7a29fb5a987e","observation_id":"09d9d026-81c7-47ef-bb80-983a28743583","resolution":{"observed_at":"2026-07-04T03:59:32.894403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:45b0f61efe4405cee0d66d74042553098ff070283ca28a9b375470ee7508e105","observation_id":"7648875b-3f7a-4c46-af90-34ae6c91614b","resolution":{"observed_at":"2026-07-04T08:09:40.664145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00125/citation-record","integrity":"/paper/2509.00125/integrity","json":"/paper/2509.00125/citation-record.json","paper":"/paper/2509.00125"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:52.012864Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.012864Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:01a8e9724159eb48ea6dee978d0da0f0074ba8ac0eb4dc0922ec83ccf7b5785b","observation_id":"0fae64bf-bc87-4977-87d0-02d7f71eaf7e","resolution":{"observed_at":"2026-08-05T14:23:52.012864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:23:52.044378Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.044378Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:622c68f40c5aef089758b75d996b703c7efb01e333cddfbd505429549d532009","observation_id":"9202f34b-3cb7-442f-97a4-4eab7dba5831","resolution":{"observed_at":"2026-08-05T14:23:52.044378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T14:23:52.097658Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.097658Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:285049220bc340b7246df7b6f4affe7aa8dec193c4b5ae7a4b93f0bf9963289b","observation_id":"4fd8135b-080c-4eec-bf07-a9e4ab3cbfe9","resolution":{"observed_at":"2026-08-05T14:23:52.097658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T14:23:52.153387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.153387Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:c93e0a7573709b7ac0558c9e6c0f139a2c59acad60fdec277087c78cb9c1bd79","observation_id":"34c9fb5e-b0bb-4a94-9879-00c3ce7d357a","resolution":{"observed_at":"2026-08-05T14:23:52.153387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:58.514175Z","title":"Let’s verify step by step","venue":null,"work_id":"d42e0208-ddc0-42d3-8ccd-5c44bde4241d","year":2023},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.193635Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:4dad88418e94f0187571fbfe94b36f0a4f6281b46746ce0f5aaec8cc7eda3e60","observation_id":"82b20f8d-b312-4c59-b42d-59e511803bf2","resolution":{"observed_at":"2026-08-05T14:23:58.685654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-05T14:23:52.252596Z","title":"Math- shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.252596Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:4ad8812a5b6c716aba4f4a36e6be05b283ee08f6746a0eb2853ba2521dad7c24","observation_id":"fb93fe45-4a55-4b3c-8e64-3b59a4fb0a79","resolution":{"observed_at":"2026-08-05T14:23:52.252596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:52.474556Z","title":"Scalable best-of-n selection for large language models via self-certainty","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.474556Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:f408df69ed865c8aa86d1fc5ae795bb2ff616c08b15f42e50ddfe260c9d25547","observation_id":"3703a958-d47e-45d0-92bb-5518f6b39972","resolution":{"observed_at":"2026-08-05T14:23:52.474556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11533","last_updated":"2025-01-20T15:17:24Z","snapshot_observed_at":"2026-08-09T10:48:09.574304Z","submitted_at":"2025-01-20T15:17:24Z","title":"The impact of intrinsic rewards on exploration in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11533","snapshot_observed_at":"2026-08-05T14:23:52.574469Z","title":"The impact of intrinsic rewards on exploration in reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.574469Z"},"links":{"cited_paper":"/paper/2501.11533","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:404f3ae29165f44e57f2d52306b45e8b84396939518f3edb0d9ab367a67e8953","observation_id":"21250019-abda-44ec-8a32-2a4851ebe388","resolution":{"observed_at":"2026-08-05T14:23:52.574469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:58.365085Z","title":"Thompson sampling: An asymptotically optimal finite-time analysis","venue":null,"work_id":"be458213-17cb-42fe-b018-7948563e9683","year":2012},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.607689Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:33a9fab6e8b2d8987f64cc93d59bef4180a8405b20627b0b7b414d8b40a63f60","observation_id":"ea1186f2-c4dc-4e56-a502-2c850b501999","resolution":{"observed_at":"2026-08-05T14:23:58.434368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:58.167564Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":"847e47d0-f9eb-437e-9f44-276928f82b6e","year":2013},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.684821Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:76c52c0ec197c451d50645c999fa9ecacaef7c9f3aa78faff6b0a216d3a56b0f","observation_id":"71f55c8d-7cfa-4b66-b4e4-a509853d5451","resolution":{"observed_at":"2026-08-05T14:23:58.287010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02189","last_updated":"2020-03-04T17:03:56Z","snapshot_observed_at":"2026-08-05T18:34:50.706165Z","submitted_at":"2020-03-04T17:03:56Z","title":"Exploration-Exploitation in Constrained MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02189","snapshot_observed_at":"2026-08-05T14:23:52.737271Z","title":"Exploration-exploitation in constrained mdps.arXiv preprint arXiv:2003.02189, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.737271Z"},"links":{"cited_paper":"/paper/2003.02189","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:796b1be8aa1805cba4569735a35af4f2f8b537f268ac8a3a2f497e0b3659aee9","observation_id":"4060531c-1847-4585-b001-198f32c05dd6","resolution":{"observed_at":"2026-08-05T14:23:52.737271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.972647Z","title":"Why is posterior sampling better than optimism for reinforcement learning? In ICML, 2017","venue":null,"work_id":"ab1016d7-2026-4442-91a8-9cf494e867f6","year":2017},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.809809Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:baa19bd215a93ab8bd2698374ed9ff04028d3240b5887b6f4a9500a4840345bb","observation_id":"822ae0fc-6db9-407b-be99-fa09a6948950","resolution":{"observed_at":"2026-08-05T14:23:58.007796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.792603Z","title":"First return, then explore","venue":null,"work_id":"70bc97b3-8f44-419e-ad15-4e8493cd111b","year":2021},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.860872Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:df65caab5ce46b877a9943c98d25d6f587142b7b4c33197b82e0269b71179dcf","observation_id":"b1e214fe-a27f-4f1e-8e68-16d1520ea192","resolution":{"observed_at":"2026-08-05T14:23:57.908440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.549812Z","title":"Automatic goal generation for reinforcement learning agents","venue":null,"work_id":"859e8861-21ad-4217-bb30-f39c2ddb1777","year":2018},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.915005Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:cc585930955c579336186646c6e3454e43e750a82a86c37ddae5fbbecfcec13d","observation_id":"5cfca35f-e4c9-4323-aab3-7ff3f6200c07","resolution":{"observed_at":"2026-08-05T14:23:57.672989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:52.986538Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.986538Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3303e319fca73d691075d6d6210ef0381da02946ffbbc54c76b3836cc2893744","observation_id":"e0896c7a-5d24-49cc-99f5-bbf3454a21f9","resolution":{"observed_at":"2026-08-05T14:23:52.986538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.322775Z","title":"Adaptiveε-greedy exploration in reinforcement learning based on value differences","venue":null,"work_id":"84cf0d86-0fc8-4991-97bb-74c45de5181e","year":2010},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.029151Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:ee20c06b86cf7f23844516d9cf6119ef11e571ea4284f75763fc12e0ced2356a","observation_id":"4b22afa6-dbbf-4e5e-a976-d323cbf41029","resolution":{"observed_at":"2026-08-05T14:23:57.397962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.171082Z","title":"# exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":"3faf2f62-48c0-46ba-b162-203a6bbafb1e","year":2017},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.107117Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:7e401d998d8ccc551adccdf7c6a503a47b18de69040b205b764f5471f50eb593","observation_id":"af537e40-7b37-47cf-8762-26f1ddde1bed","resolution":{"observed_at":"2026-08-05T14:23:57.233013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.958523Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":"7ca559b4-847c-430b-a03e-97c696f34808","year":2016},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.159916Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:e0688b49537c615030fdd9881fb684d9a2d3a32a08e308d407873d14616b1c91","observation_id":"625027fc-5657-457b-bc6a-a25ba0a7f7ea","resolution":{"observed_at":"2026-08-05T14:23:57.077614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.735880Z","title":"Curious model-building control systems","venue":null,"work_id":"fee7794c-46e5-40dc-a334-5c2bfb72ebb5","year":1991},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.219109Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:b1fa70c233714066ace29e79bcc02ebd3d1c2bda9ca07d8db74b4a743b7cc7dd","observation_id":"47b9055b-4018-4590-9ea4-cd41539fb231","resolution":{"observed_at":"2026-08-05T14:23:56.843868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.503041Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"51db2bc7-242f-4b00-9fa1-262c503fc878","year":2017},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.288373Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:4ad72e3ccbdad15a0634a6ae522033f48d17f4232479238cc6dc9c20eebc10cc","observation_id":"f64fc493-eefc-44ad-931a-d5febad69903","resolution":{"observed_at":"2026-08-05T14:23:56.624749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T14:23:53.349740Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.349740Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:2465ac86c51d4ee068ae9ac980587b889fba0dfa96772d7477dd204f618d7a2c","observation_id":"071b3708-a6bb-4d24-9a98-dd9e66e6f994","resolution":{"observed_at":"2026-08-05T14:23:53.349740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.288202Z","title":"Planning to explore via self-supervised world models","venue":null,"work_id":"02655704-e194-4a45-b66e-05d0a8676f7b","year":2020},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.445822Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:ad275294bf7d0b50123ecf439c5d718dddee66f82dc12967877697b9d6862dd4","observation_id":"b194bb3f-0f88-4cef-83ff-3c494a524657","resolution":{"observed_at":"2026-08-05T14:23:56.400136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.007922Z","title":"Vime: Variational information maximizing exploration","venue":null,"work_id":"379cb323-7088-405a-8cfe-7f7d0495d866","year":2016},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.513064Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:787ed2aceee311cf1b9cabc07bd69579ce9581f6ad8412ccd9e9c901d849f610","observation_id":"954ec9c2-13a1-461f-8f5b-5848e91dbe33","resolution":{"observed_at":"2026-08-05T14:23:56.128094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:55.701525Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"c5c24cf4-6d7d-4d1b-9bd6-6caf29719481","year":2019},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.586478Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:bef98ad01745bd55530e343c6360ced8630c28cb1b4e62df51ddc0a5e7dd070a","observation_id":"b7cc4687-085e-40d0-bed4-45c222baf6b1","resolution":{"observed_at":"2026-08-05T14:23:55.855227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:55.414694Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":"c5046f7c-cf9e-46ab-9c6d-d81aa6ff7bae","year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.655512Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:b0f980d5a8952c9e2e80069b0b9238532491cb7302475a0876ddba502fafcfb1","observation_id":"d57a21b2-6589-4b9f-a40b-01630ae61e98","resolution":{"observed_at":"2026-08-05T14:23:55.542844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-05T14:23:53.726913Z","title":"Learning to reason without external rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.726913Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:09fde66e8535130ec3ea4fdfd913c0b3edde5385d4f3d574078a22b019f88ba3","observation_id":"9420cb17-f685-4dd4-a6d8-48a6600f33fa","resolution":{"observed_at":"2026-08-05T14:23:53.726913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T14:23:53.805378Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.805378Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:830cc3ed65e9107629d80e752a0738ac17179fa6f2f2ce225e10c7f8f7589f00","observation_id":"747bd84f-aaff-4c49-8042-15dc9311dd0b","resolution":{"observed_at":"2026-08-05T14:23:53.805378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-05T14:23:53.864174Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning.arXiv preprint arXiv:2505.15134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.864174Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:c1914f73ed5eaf551c9f1f0d3f056e6355bcb5ebeb322e19ba9b04a6ecebcf89","observation_id":"91c343ed-07cd-4656-85ed-de4239c3f1c1","resolution":{"observed_at":"2026-08-05T14:23:53.864174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-05T14:23:53.913129Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.913129Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:6ab77dd5d0748b4001573da6f9eaadd6f04dd1c1c643edbb01b2e18a281f838e","observation_id":"72352bc2-0201-46b3-9b37-71dd8e686483","resolution":{"observed_at":"2026-08-05T14:23:53.913129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T14:23:53.993294Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.993294Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:d2f25c76c6c288f622f68a5d7108e662b2fc82fb810dc59628ced6513e16bd30","observation_id":"f2e1034f-eb4b-4ef7-9838-69608525c0c4","resolution":{"observed_at":"2026-08-05T14:23:53.993294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-05T14:23:54.061991Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.061991Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3cebfb94a5b8929809553c5e24b280342dfc84c291f9dbf64415b2fb9d4f7f12","observation_id":"7d8e9ecb-8f18-4653-b893-fc7ccde05aad","resolution":{"observed_at":"2026-08-05T14:23:54.061991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T14:23:54.165008Z","title":"Reasoning with exploration: An entropy perspective.arXiv preprint arXiv:2506.14758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.165008Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:aacbc1c39456a38f562c8bec96d046cefb66768fb3b195b83d7eb208d853d5e9","observation_id":"f036f048-214b-4d9e-8a89-9046536ab732","resolution":{"observed_at":"2026-08-05T14:23:54.165008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T14:23:54.263620Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.263620Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:6490381a67b9a26723ae0b009e945d55430b7f04b8802c7b3e665f832e88f735","observation_id":"77947edf-38ea-4181-93e3-f094562744d5","resolution":{"observed_at":"2026-08-05T14:23:54.263620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-10T02:01:09.632053Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-05T14:23:54.346422Z","title":"Free process rewards without process labels.arXiv preprint arXiv:2412.01981, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.346422Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:04e7121762f03903df791a6fcaf9673e3654288e8a6bd58cb6b7e8e0ef36a4fe","observation_id":"c944a4df-f17b-4859-8da6-eafd9de83834","resolution":{"observed_at":"2026-08-05T14:23:54.346422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T14:23:54.429131Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.429131Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:6c0a2f5a514d56875015fdbed7d94c49c5319a9181e97cb00dfa2b0ec8955e07","observation_id":"6ace7843-b82d-4429-a83c-473e3d336d9d","resolution":{"observed_at":"2026-08-05T14:23:54.429131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T14:23:54.506644Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.506644Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3b19351706fcbd92cae65e111f82b68de14a5acd9547f714d664a8e1c35808fd","observation_id":"1e3a05f2-725d-472a-89fd-6cf0e83dd2eb","resolution":{"observed_at":"2026-08-05T14:23:54.506644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T14:23:54.563362Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.563362Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:55a715d8800d5607f46b4ee817dbbc6a5371fd3adab19843a0898747165eba67","observation_id":"7bcc21ec-a01b-4b73-b936-4c3833198956","resolution":{"observed_at":"2026-08-05T14:23:54.563362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T14:23:54.656234Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.656234Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:beb4e4a83f9d85e8fef808a71c9db2c133e343b4e41969393fe73ce358c64c33","observation_id":"5a84f266-0bad-4488-ae18-149dd2857216","resolution":{"observed_at":"2026-08-05T14:23:54.656234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:54.766364Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.766364Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:c070d77c7714ab3d8ff2f4d54d907f94f09680ad52394815583c59a818e94a25","observation_id":"1f7d0dc9-5dd4-47be-8d47-40168e4891c3","resolution":{"observed_at":"2026-08-05T14:23:54.766364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:54.804613Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.804613Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:ebd4d602b427cf86144328e492cdd47cc366ad457492dece6d0e521b57a2dd85","observation_id":"7ab1850b-1883-4ced-b777-0144ee09d814","resolution":{"observed_at":"2026-08-05T14:23:54.804613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:55.157207Z","title":"Math-Verify: Math Verification Library.https://github.com/huggingface/math-verify, 2025","venue":null,"work_id":"45af7fff-c042-4a0c-a93b-7753e5f1d39b","year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.829237Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:35bbbf086f57d4887a15e1365c2b37d8be7add48b3e987ac116d0f3152715b88","observation_id":"3480521a-824d-43ae-a716-80da712b82e7","resolution":{"observed_at":"2026-08-05T14:23:55.242466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2509.00125."}