{"as_of":"2026-08-18T19:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c68123fd3ace96cf972a05b53317ab440215993cdd0c7ddb115f15b92be70b95","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T20:01:06.623978Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04332/citation-record","integrity":"/paper/2607.04332/integrity","json":"/paper/2607.04332/citation-record.json","paper":"/paper/2607.04332"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Zhang et al.,A Survey of Reinforcement Learning for Large Reasoning Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:5ece0da32fd44935b5d1956f2a9e2d01945e5dfa6b71943a1659d23bae364a12","observation_id":"a220e5de-7d5c-4501-871a-ccaa756fe300","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-08-15T23:34:04.639134Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:9abaed4a174ba317b4838f8a8062cac4fbd85395964da3a465d4f43afa74b14e","observation_id":"14b14a91-0652-45ef-89c9-6e2f347d73b7","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00977","last_updated":"2026-05-14T04:25:16Z","snapshot_observed_at":"2026-08-05T08:37:33.456673Z","submitted_at":"2025-10-01T14:52:11Z","title":"It Takes Two: Your GRPO Is Secretly DPO","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00977","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Wu et al.,It Takes Two: Your GRPO Is Secretly DPO, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2510.00977","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:3bf5d1a268967b5df218297eb9a52e52b95d8e59acd9b624ac91176a421ac012","observation_id":"8cdab405-7cf5-4d94-be43-5d3540f04d9a","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Outcome-based Rein- forcement Learning to Predict the Future,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:85bfec1031bd5b80429ee9304832ef4d67eb8b02360d20a596b69bf64deeac24","observation_id":"8d8dfb08-5b5e-404c-9640-a71ee07a683f","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Firm or Fickle? Evaluating Large Language Models Consistency in Sequential Interactions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:738786a52d4fafae3189834299b460ad6fe2e499fecd2246f6f390e8f89d9dd0","observation_id":"72a7312b-b801-4abe-9926-cf3ff656fb01","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:5d667afbf2b1d52e256b935a389aca176004342abb976505d032001975d1dc0e","observation_id":"9fcdf683-f389-4078-b34a-6fd8beecd64e","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:17409d5168c244b09c40daabb96049add1be688005c97175030f0ccdcf85d0b1","observation_id":"2105efa6-413f-40c9-8f38-ccba8458c4e2","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:3728925296ca08dbe222ad2b3519671717ffbacdebb66637366ee99e936813d6","observation_id":"1e1ac6df-f903-4a0c-ab74-697491d8a9a5","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Achiam et al.,GPT-4 Technical Report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:7f36b14478a6ba40b2b559dc451b4193ef6250e314f2341b77fcc2554b55d674","observation_id":"552e4d26-c4c1-4602-b77c-a61592b04498","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"SFT memorizes, RL generalizes: A comparative study of foundation model post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:1f63fea7b34fbd96674312a60d051e1694bc58f4bf180db53a37aab825600f06","observation_id":"829a1b1c-21f1-481b-9f62-9c15450639b4","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"RL’s razor: Why online reinforcement learning forgets less,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:8e13d0c9e5307d9ec8d6f0d9097262582bf55c440633d8830656e3a0b7296c73","observation_id":"eb3bfabd-0f07-425b-aea1-b5ac96dc0ca8","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:b47e824e5b351df2bb1475961e965b2f4281d1687229ee7671e6c0afe20d8d20","observation_id":"20833cee-8b4b-4ffc-a583-9bc80c1e743d","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"SaySelf: Teaching LLMs to express confidence with self-reflective rationales,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:df88ad6d6fdddaca371158ec70fc67e48fa01da2b12ce3b36d25b2b31e9b9081","observation_id":"f41aa734-1a8c-4352-957a-802fff9735fd","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05881","last_updated":"2026-06-03T09:50:09Z","snapshot_observed_at":"2026-08-15T09:05:26.990237Z","submitted_at":"2026-03-06T04:03:13Z","title":"Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05881","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2603.05881","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:3e90369cc3046f609cf0ce0c2afc1bf576f7e345f1723e852ae7159c98c35a11","observation_id":"5f41b44a-aed2-453f-bdb2-d7fe5ee1d8ea","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Shao et al.,DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:86b37c8c9d1f9694fcc2814cdb6ed4742f95f85b2427c61a8a10758a2782f204","observation_id":"ea9945b7-bd89-4aaa-b59f-77455df36b64","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Admissible probability measurement procedures,","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:4769f236cb9752470b83d37a653274d29aee9d2d62e0f81ab387710f88909ae0","observation_id":"6c1dd897-8b16-4eb1-ac37-adabd9cc5d5d","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:b84e865c3fd2d2bc2a4d850f63597a0424637d7f82a462e5c1aad89bcc4298f9","observation_id":"f9727fec-f34c-4af3-890d-d4e977eaad9f","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03216","last_updated":"2026-04-03T17:44:32Z","snapshot_observed_at":"2026-08-17T12:22:54.414251Z","submitted_at":"2026-04-03T17:44:32Z","title":"BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03216","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2604.03216","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:d97d7012bd100ca91a9ecd52842531a6ebdab62358544ae5e145ed2e67a47d79","observation_id":"fbc17b0a-6311-4668-89b6-f506f9bbeb86","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-08-16T21:03:22.901798Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:a38f827402461e96c8701e542e34de85fbbcadbca245d0c063f3ba8dd29a338b","observation_id":"a48ec1e8-5be8-40b7-834a-7ea622dc476d","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"HotpotQA: A dataset for diverse, explainable multi-hop question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:2371ca593d27d567f64e57cb7a99b8d9c1dde9e504aa2149ab0b0d06acbc0b23","observation_id":"58ce190f-a24f-46e5-8dfb-87ec167a8392","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-18T07:57:35.968161Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Albalak et al.,Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:6dc6e415e531cc15716d75f3dadca56b28cbd2bf274241684cdd76e7dbb1e0bd","observation_id":"b88bc4ac-058b-458a-800b-2418edf48972","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifi- able Mathematical Dataset for Advancing Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:df0dccd81bf4cce23001d267849453b9c0b863a1e4d64982c22ae8cd886dfa97","observation_id":"f640058f-4066-40c0-b8b7-8541b8dd9730","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Qwen2 Technical Report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:df04325afa151b4a78ae56965f0fdc1d6fb54e50b868aed8678b38569cb6c567","observation_id":"b495b955-400d-485b-bd24-cc79af99dc45","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:012a2f6f2e9900c88fe7470c1c4911bc61cde616c557a266eb6e0384b3b0a58e","observation_id":"195e7627-36c7-40e6-a00c-1042e9f08ff2","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:4958e4fa6de4d1e43f1191e059ddbdcea094e084132670afd177ff118446a9c6","observation_id":"59fbb22e-1df8-4f57-ac4e-e9641c1fd19d","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"arXiv: 2505.09388 [cs.CL]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:f151b0fbb854b4b0d9d66be6fae2bd21b0be9fd0d0e62779653b3ff6538cc416","observation_id":"5ed11d6c-ee92-440b-8fb4-94d7cf5a503c","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:40813af5b9b47e4d25613595e3c499d52affd33f63b3597fd2e10258451ccb9c","observation_id":"fe127a5d-f4d4-4a23-95c2-5cf57a3c2661","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"A General Method for Comparing Probability Assessors,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:346fe933ecdd6c4d0aa4d67f2ff7ae36eb666894ca86674e111bbb3e644780d9","observation_id":"aaf0b481-ec22-4976-a8db-0cf8c7b45d8d","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:46fc71e702ab78a9c6854234936f1a5477294484d84ae71331eee6a32f911830","observation_id":"3efbe34a-f4f6-45fd-b435-8693e67a15da","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Strictly proper scoring rules, prediction, and estimation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:8b7233acc65b114a50c584b269aca4dee31ecd2b28d3999b810936dce2c478ff","observation_id":"c2bfca92-7de1-4bdb-898f-ca227b722aa5","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:ba0e02f1e8261a3a74d7cc920d6ec90e9befc4e7a4ed6893a3da6580167f03b1","observation_id":"c213e2d3-1013-49eb-86aa-e42925393cce","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11800","last_updated":"2025-08-15T20:50:53Z","snapshot_observed_at":"2026-08-15T17:28:15.425613Z","submitted_at":"2025-08-15T20:50:53Z","title":"Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11800","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Bereket and J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2508.11800","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:615edccf36c3155b624235445c65ebc2ac43f848d89c8c7035e630778aa0ad65","observation_id":"d486a7fa-41ef-40f6-972b-059fe2b112e7","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:22d86fe174b32dcbe4d2f5b69487fb5c0ca903fe0ff8b17d848b11fef6c4ec5b","observation_id":"6a8a7361-e3af-4335-aa39-bdd53b5ba9fa","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-15T12:29:38.248604Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"[Online]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:b5f66e29f4735ce11eb984432a19f6bbe7b5faa0706d85666c18e94d7c84bc20","observation_id":"c259ad32-a8d4-4767-9fa4-d4faf44a274a","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1960.105756","doi":"10.1109/tit.1960.1057560","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A statistical theory of target detection by pulsed radar,","venue":"IEEE Transactions on Information Theory","work_id":"edfa7122-2786-4bb5-944c-8e57b9a51bdb","year":1960},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:99b26ab93d340c02ba64ea3bbd184ac4128ff21e2fcda305bca1dade213e2bff","observation_id":"33e8cbd5-89f1-4c0e-9127-07b3c1a6ac20","resolution":{"observed_at":"2026-07-11T20:08:14.251687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T10:19:20.741907+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T10:19:20.741907+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"The theory of signal detectability,","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:6395c89dc6b3d767086d5f55b8a6595de27187b9bbc28318d8f13678bdf23ade","observation_id":"ef4e4af7-e240-4f84-9688-f525108920a3","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Verification of forecasts expressed in terms of probability,","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:19d39ed2c9c6f648442bc2fe1d62e4e253a935b7c80fae6a5971b5a81c82b31c","observation_id":"6f68b387-ed16-4195-b404-b2759d6b5463","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:98a84ce590d52f4fdb46ab45175b7c6bb7becf1431bd3f1bcd8aca063fc4f003","observation_id":"20230dff-c10a-4d32-9cfe-d403097cc923","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Available:https://aclanthology.org/W04-1013/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:dda2328b118e99715d0cc990b1eeff62850ef13ea48a1e01515c93402cd7007e","observation_id":"eb4943ac-b91a-495b-b4df-7686b2808feb","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:ea41e65aa5da2f7e7e9b3d705ef46ef6be25978424c48b6c9ca9694f61ff91f7","observation_id":"e083bd8d-01fd-45b0-b92d-6a2988c40621","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Decoupled Weight Decay Regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:f4f2b6aba5ac95491f83a09d863ff3e10ed5b57a97e3ee02cb9e742e385e2c8e","observation_id":"aec3a7e3-3fd6-44f2-af9d-435d2c2b9de0","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:b2bb4806aed617e68dc8b843c51673ebd10b6f5ff28231836e42fdf1dc575a07","observation_id":"3fc90be2-76fd-43d7-8142-ddd6367fbbc9","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Devic, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:73b6ae207204952f51c27d3e6664d130029018d82ec83c9bab94870a78b5b48f","observation_id":"089d2199-ed5b-4cad-a769-2b66af852dd3","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"abstention reward function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:e10a2ec4f0d532490828fe8594cee294e33441051064e20da412fcce1453e4ef","observation_id":"884c7249-7ac2-4069-8493-394f70e9f434","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"For our experiments, the minimum possible representable confidence value is 1 202, hence confidence reward hacking cannot take place in Log- 1 ln 202","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:a8fde3e5297c2a3efac0eff490fe75b5efaad0d34743dd23204f57e1463883cc","observation_id":"8ef90444-179c-411b-8300-920208accd13","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"In Appendix D.1, we generalize this finding by proving a sufficient condition for a non-hackable reward confidence scheme to exhibit overconfidence or underconfidence bias","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:4c4184638243d6fa3f34fe84db4d5625e1bc67853cbb710180195c2a92b967f5","observation_id":"e875adf7-587c-48a2-b0fc-13bdb7690e48","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"Final Answer:","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:20cd63f909fb9821efe87d841f6d8594a90d8e8095a4f413f283e79bf22a34ad","observation_id":"a52d87f1-9274-4cd4-a338-e26bd7cf9c34","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:18f25085b465dbbcf69988b90d9a8938b0673ae343db19ceaf73cc9cb8441297","observation_id":"dc10e0de-61c2-4e28-bf46-4f84e7eb5743","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"For mathematical answers, answer in LaTeX format","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:aad880f4633111dbb6c56dec193aaa575f3aefd6e3b9d604e6fd0a5393db94be","observation_id":"a37ac73c-4a2b-4f5e-a98c-5697128d98f1","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:245b501417a4782773cb419cd616008982b8c62737e7fc0efae822e84f34f3a1","observation_id":"cb868bef-2c00-46b5-8a2a-400ce35bbee4","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"The Grand Tour","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:9dd092435c5f7b75027b3dce9db66f13b61557b4a946e451eb12278f6b7fee7f","observation_id":"c11076fc-4da9-4b45-8a8a-d508b8ebb589","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T22:59:02.669699Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.04332."}