{"as_of":"2026-08-06T15:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0885d11c698857a265cfa819d0ecaff716a3dff1becd9cd14bc85c0488816019","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:02:40.647686Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:16:41.377531Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-08-04T07:02:40.647686Z","title":"Beyond binary rewards: Training lms to reason about their uncertainty.arXiv preprint arXiv:2507.16806,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-04T07:02:38.694383Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:40.647686Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:60d7718c73a1d9cb285778f6c1d174ecd0402312acb97a2e93e5f2b16f10a760","observation_id":"1bd4210d-d2c6-447e-96eb-f8511bb5a4f0","resolution":{"observed_at":"2026-08-04T07:02:40.647686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2601.05905","last_updated":"2026-04-07T05:02:53Z","snapshot_observed_at":"2026-07-31T21:26:13.540947Z","submitted_at":"2026-01-09T16:23:21Z","title":"Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T15:51:09.563645Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2601.05905"},"observation_digest":"sha256:227b01bb38260170329e64cf05c6aebf384a4f42a9e2add88e08d1aea702d122","observation_id":"e921c058-71ed-4487-97e0-ed7f055e6405","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-08-03T10:14:01.961040Z","title":"InProceedings of the 47th International ACM SIGIR Conference on Research and Develop- ment in Information Retrieval, SIGIR 2024, page 719–729","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.11004","last_updated":"2026-06-11T02:09:41Z","snapshot_observed_at":"2026-08-03T10:14:00.066204Z","submitted_at":"2026-01-16T05:38:25Z","title":"NOVA: NOise-aware Verbal Confidence CAlibration for Robust Large Language Models in RAG Systems","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T10:14:01.961040Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2601.11004"},"observation_digest":"sha256:65d7f7d0d02c9f572befebb8bdde3a19f26afdf8aeacc728e72a6bd281d42946","observation_id":"67e9d420-fd80-48b9-9d76-73a7459d3000","resolution":{"observed_at":"2026-08-03T10:14:01.961040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-08-03T00:05:07.481901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11719","last_updated":"2026-06-10T14:31:47Z","snapshot_observed_at":"2026-08-03T00:05:05.794136Z","submitted_at":"2026-02-12T08:48:51Z","title":"Uncertainty-aware Generative Recommendation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T00:05:07.481901Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2602.11719"},"observation_digest":"sha256:bd6e8d9afe7d40bba5bcba0498f265c73dd532c3fcdfb4b1e11876d0bf6eb7f5","observation_id":"8f2442c1-c3df-4f79-a4df-940c482e1488","resolution":{"observed_at":"2026-08-03T00:05:07.481901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2603.09117","last_updated":"2026-05-27T02:49:05Z","snapshot_observed_at":"2026-07-15T12:13:14.577374Z","submitted_at":"2026-03-10T02:47:59Z","title":"Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T13:49:11.758336Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2603.09117"},"observation_digest":"sha256:4f6ea6d5fcdf634200c09a3c2d80f72614a743475fabcb2a0ab7c74ca285396e","observation_id":"b1344618-1b6b-4c0c-9a19-baf814829d52","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2604.12632","last_updated":"2026-04-14T12:03:17Z","snapshot_observed_at":"2026-08-03T05:40:03.205960Z","submitted_at":"2026-04-14T12:03:17Z","title":"Calibration-Aware Policy Optimization for Reasoning LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T15:40:24.396851Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2604.12632"},"observation_digest":"sha256:4411c3d8077fb629ff2bd7ddf12ec95aa1590c594aac454108162fc2f94977c5","observation_id":"69f1f055-77d2-4d4f-b1aa-e3eb760cc886","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2604.19444","last_updated":"2026-04-21T13:25:25Z","snapshot_observed_at":"2026-08-02T05:26:26.148681Z","submitted_at":"2026-04-21T13:25:25Z","title":"Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-10T03:13:35.541936Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2604.19444"},"observation_digest":"sha256:70fb74becdae0846e6d6128b68cfe46a020ac178b289918359110874fe3053a1","observation_id":"41bd6740-40ce-4cfd-9295-9c9cb651bf33","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2604.22110","last_updated":"2026-04-23T23:06:48Z","snapshot_observed_at":"2026-08-03T03:45:15.450142Z","submitted_at":"2026-04-23T23:06:48Z","title":"Do Not Imitate, Reinforce: Iterative Classification via Belief Refinement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T21:48:15.641442Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2604.22110"},"observation_digest":"sha256:bedceef4c17e51fc9ce3fa39a444cbd6312218bd30c394fd1c33eb243b260940","observation_id":"1f5cd2f5-848a-4c68-95ff-c5e76c3d4a40","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:7dc4d7b8cc063cc7a21635f0b9001b4ea1eb40efcee6b2e5b581bdecc058d05d","observation_id":"a0df8c10-e56c-4d0c-9234-65c0e2dc5bd2","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2604.26152","last_updated":"2026-04-28T22:27:54Z","snapshot_observed_at":"2026-07-06T23:11:52.954360Z","submitted_at":"2026-04-28T22:27:54Z","title":"AI Observability for Large Language Model Systems: A Multi-Layer Analysis of Monitoring Approaches from Confidence Calibration to Infrastructure Tracing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-07T15:40:05.520653Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2604.26152"},"observation_digest":"sha256:4cc8c056aa777f977a57ec739b1401edc1e2cd37ff98e4bd310a8751d056d1cb","observation_id":"f19aea86-4f9f-454d-9542-e32534dcbe8d","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2605.06785","last_updated":"2026-05-12T15:55:34Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T18:00:04Z","title":"Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:17:01.225189Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2605.06785"},"observation_digest":"sha256:c425da0f2f56cd8a814ed47d86bbe1862ed73f454d4da1fc0a3f48a97ac8ea59","observation_id":"6d88a72d-4347-4b89-a1bc-1fe8da7854c6","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2605.06785","last_updated":"2026-05-12T15:55:34Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T18:00:04Z","title":"Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T06:27:19.650539Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2605.06785"},"observation_digest":"sha256:efcc45a6c017f282b32262bc29794633e22e2a4ae1c1d08bc52445433dbbe257","observation_id":"c3fdc429-6b12-4ac1-94d3-a7fda9fc5e3e","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2605.25381","last_updated":"2026-05-25T03:10:51Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T03:10:51Z","title":"Not only where, But when: Temporal Scheduling for RLVR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:34:44.791173Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2605.25381"},"observation_digest":"sha256:7360a552f3dc90d3325005d4ad3bd0011e99f1eaa61a6e2f5c8188e817ce8d7d","observation_id":"06c97919-bb19-413a-b386-62b0c6bad39a","resolution":{"observed_at":"2026-06-29T22:44:01.846492Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2605.28070","last_updated":"2026-05-27T07:28:25Z","snapshot_observed_at":"2026-08-03T11:47:22.689668Z","submitted_at":"2026-05-27T07:28:25Z","title":"Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T12:37:16.138816Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2605.28070"},"observation_digest":"sha256:814a5b4d91373b795ba8af3f7f8d0bf7be1a80a17d12a3519bd375eecf7c9240","observation_id":"989d4b74-f5ea-47d1-9b21-4ea02128f614","resolution":{"observed_at":"2026-06-29T12:43:25.798054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2605.31464","last_updated":"2026-05-29T15:56:08Z","snapshot_observed_at":"2026-07-06T23:40:36.926513Z","submitted_at":"2026-05-29T15:56:08Z","title":"GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:09:57.297404Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2605.31464"},"observation_digest":"sha256:4bba16976bdab70688e83d8ab04c9545b0cb8b7335f6bc2f28ce103ba2e33946","observation_id":"621db6b5-1b2a-4b7e-a8e4-9b8b9beb9821","resolution":{"observed_at":"2026-06-28T23:12:46.894665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2606.00869","last_updated":"2026-05-30T19:53:19Z","snapshot_observed_at":"2026-08-01T18:48:30.860504Z","submitted_at":"2026-05-30T19:53:19Z","title":"Enhancing LLM Metacognition via Cognitive Pairwise Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T19:01:18.153145Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2606.00869"},"observation_digest":"sha256:38c8bbfb0dfbe84b398c325d51caf6c090497d49e0302fc5b3a88130c9f31143","observation_id":"297b0023-3a7d-453c-bc1a-5b71026d70f3","resolution":{"observed_at":"2026-06-28T19:02:33.868887Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2606.24281","last_updated":"2026-06-23T08:03:20Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:03:20Z","title":"CALIBER: Calibrating Confidence Before and After Reasoning in Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:10.687624Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2606.24281"},"observation_digest":"sha256:0c48729af61039c8c0ba000deb7f3e7c82c7aa21a4899ac67412ce827aeeb1c5","observation_id":"df57e23f-26b7-46f8-825e-bc09081797da","resolution":{"observed_at":"2026-07-04T16:39:58.407338Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2607.00164","last_updated":"2026-06-30T20:42:45Z","snapshot_observed_at":"2026-08-04T14:45:57.113312Z","submitted_at":"2026-06-30T20:42:45Z","title":"Verifiable Rewards for Calibrated Probabilistic Forecasting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T19:45:23.721172Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2607.00164"},"observation_digest":"sha256:6a49a5cd74ec3569469e80af3740753d1b30857f7735b48e6abc693f296f8d73","observation_id":"13477cd2-2cb6-4fcb-9b6e-bbdf4e762c6c","resolution":{"observed_at":"2026-07-02T19:47:18.734131Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2607.08046","last_updated":"2026-07-09T01:52:09Z","snapshot_observed_at":"2026-07-12T23:18:15.686521Z","submitted_at":"2026-07-09T01:52:09Z","title":"What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T01:09:53.133146Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2607.08046"},"observation_digest":"sha256:6902375fd4fa40d9ac73d62e7adcd6173fe7b448416c27aa4438291e4cce8c2f","observation_id":"e13225bf-52b7-4951-86b6-efb0cd9277f5","resolution":{"observed_at":"2026-07-10T01:16:41.379275Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Beyond binary rewards: Training lms to reason about their uncertainty.arXiv preprint arXiv:2507.16806, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-02T07:22:05.963032Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:1bb3081af8aa39c3e146865700d7d0cc9d2107a943159b3703cbc42005309dca","observation_id":"f70029e2-a09f-404e-afdb-cc00f2c50e31","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-14T07:36:47.336670Z","title":"Beyond binary rewards: Training LMs to reason about their uncertainty.arXiv preprint arXiv:2507.16806,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11022","last_updated":"2026-07-13T02:41:16Z","snapshot_observed_at":"2026-07-16T23:19:09.091393Z","submitted_at":"2026-07-13T02:41:16Z","title":"When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T07:36:47.336670Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2607.11022"},"observation_digest":"sha256:45273ec961b1fb581f8645fcb397be11d4e0671cfd30a50f8edc898208381ce2","observation_id":"1b9d681c-d250-4dab-8d7f-ef68195f2211","resolution":{"observed_at":"2026-07-14T07:36:47.336670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-08-01T11:39:58.932821Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19847","last_updated":"2026-07-22T07:32:09Z","snapshot_observed_at":"2026-08-06T14:38:24.039282Z","submitted_at":"2026-07-22T07:32:09Z","title":"Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:39:58.932821Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2607.19847"},"observation_digest":"sha256:35c2304a2f7d6652cd0fa7ca5471398c26f347582e15ab8dddbdbd119fee5e11","observation_id":"b810c039-a49e-4cf9-b93d-08407d0aa717","resolution":{"observed_at":"2026-08-01T11:39:58.932821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-08-04T00:53:26.000469Z","title":"Beyond Binary Rewards: Training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00301","last_updated":"2026-07-31T21:31:07Z","snapshot_observed_at":"2026-08-06T15:12:30.307039Z","submitted_at":"2026-07-31T21:31:07Z","title":"Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T00:53:26.000469Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2608.00301"},"observation_digest":"sha256:e103a306dd5e522bd86ac0faa637c999d4a1a405353e059ea4bffe83096835c6","observation_id":"57826263-223c-4742-be08-037d3faa7ccf","resolution":{"observed_at":"2026-08-04T00:53:26.000469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16806/citation-record","integrity":"/paper/2507.16806/integrity","json":"/paper/2507.16806/citation-record.json","paper":"/paper/2507.16806"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14737","last_updated":"2026-05-05T09:22:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T11:10:36Z","title":"On Verbalized Confidence Scores for LLMs","version":2},"cited_work":{"arxiv_id":"2412.14737","doi":"10.48550/arxiv.2412.14737","metadata_source":"pith","pith_arxiv_id":"2412.14737","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"On Verbalized Confidence Scores for LLMs","venue":"cs.CL","work_id":"2f06055e-cb87-48e6-b737-6a084329edd5","year":2024},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2412.14737","citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:566619d4fb663f58ba0726000d7e39c01d4d63326c2f43618c3ff95bd0a69f9d","observation_id":"0b7d3200-c7e3-4215-9e60-38b7914c7068","resolution":{"observed_at":"2026-05-22T00:04:27.005902Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"446a8cfa-3f83-4316-b010-0784d9ed3cee","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:c54dd7410d056b6d6808376a9c387e150ea582ead3f0375fd6e5078c1f4059a4","observation_id":"927f5937-e63b-4851-ad4d-b1db1700c5f5","resolution":{"observed_at":"2026-05-22T00:04:27.224097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Examples","venue":null,"work_id":"a60d6efa-ba9a-43f8-8d42-bcf8bf3957e2","year":2018},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:05114c1ee73b0a8c2e00ad5c80dc728201390ea30ef6437fc531d3d0191bf398","observation_id":"87ece4b9-2b42-4cb6-b3e8-6e006056ffc7","resolution":{"observed_at":"2026-05-22T00:04:27.230608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We slightly modify the dataset and remove 2 non-relevant paragraphs from each question","venue":null,"work_id":"bb1113bf-bf85-4109-b8eb-430042ae484b","year":2018},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:fb8e3b147c9d2b2b1e479f19b97dd01a441f0df61d725331573d1e6264694444","observation_id":"a260b798-1c21-4ad6-b451-ce8f3647a295","resolution":{"observed_at":"2026-05-22T00:04:27.234085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We measure correctness using exact-match","venue":null,"work_id":"120ef600-e0d3-4e95-84d9-051cdada4595","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:a7c8b51981f7618ab3b3b505c1478552e2198db3ec9b78d7b9de3aa5dc277319","observation_id":"733a1dde-71de-4af8-8061-992413258c65","resolution":{"observed_at":"2026-05-22T00:04:27.194680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We use the no-context split to purely test factual accuracy.We evaluate using LLM-as-a-judge","venue":null,"work_id":"20c8fb2b-9a35-4b6c-95a0-328d0fbece0d","year":2000},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:113edb2873370993cd801743346302791b3045b5af5a04a1b15d392c29b5adcb","observation_id":"74478e29-8f43-47c8-a2c1-c829b18a38f4","resolution":{"observed_at":"2026-05-22T00:04:27.211984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We evaluate using LLM-as-a-judge","venue":null,"work_id":"bf12b1eb-4fe5-43eb-8de1-0f1300b324cb","year":2024},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:cf500da7b7b14623447b39220da495390c0a0d4286f7882454e89041a2e4b580","observation_id":"04c311f4-82ba-42e1-9a3f-891bd1cbea95","resolution":{"observed_at":"2026-05-22T00:04:27.216034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We evaluate usingmath-verify, a mathematical expression evaluation system released by huggingface","venue":null,"work_id":"a9cd7664-c4e9-4f8d-8741-e5402f083465","year":2021},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:f8df0ec6ef4bcd2b0275f0e4879318da022608685a1a4d1afa8995fc9f29f750","observation_id":"9353cf4d-a698-42b9-8793-c7a50f2c785c","resolution":{"observed_at":"2026-05-22T00:04:27.203529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We evaluate using math-verify","venue":null,"work_id":"6475777f-0c51-4b74-9fb0-b40b8c67edfd","year":2021},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:ffcf12f8443825f647fd532a431b78355188e9d89a97006e99ebd23366e564bd","observation_id":"39c8870b-725a-42aa-944d-c8f4e9e2d74e","resolution":{"observed_at":"2026-05-22T00:04:27.175155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We evaluate using math-verify","venue":null,"work_id":"0693032c-e271-4d6e-8f23-737e89c7b31c","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:2d04416e6dbff937cb656b9433a849882471e50b5651b83cec88a951f5931297","observation_id":"2829eb6c-8b03-4eb9-b858-bbf1f607e683","resolution":{"observed_at":"2026-05-22T00:04:27.223828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We evaluate using LLM-as-a-judge","venue":null,"work_id":"cc195658-7b7d-4a11-870d-503d42491ba6","year":2019},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:a64e0c65cec84bfd59cbaa28b2b524a647132ad40b940866aae8faec0098b222","observation_id":"9a002f2f-20d0-4a75-af44-e001dd7827d2","resolution":{"observed_at":"2026-05-22T00:04:27.192871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We evaluate using LLM- as-a-judge","venue":null,"work_id":"8c2eda3a-4485-4e6d-876e-5242fd82221e","year":2024},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:16646c572e6c72d486c078b87f65b7e7fc006f522d92eae8c36e30facf472f2e","observation_id":"6148607f-ee27-445c-9e8e-5273bf446419","resolution":{"observed_at":"2026-05-22T00:04:27.196433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"They are evaluated with the same system prompts they are trained on","venue":null,"work_id":"44d2f776-6b95-4f5e-9436-d38c2d681e37","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:eebbc44eb9e93522779d83cf28fbabcdb3e913138ed3a0a24ce9211969d6ae01","observation_id":"a6cc23ba-9e57-448b-9171-731d716b0fe0","resolution":{"observed_at":"2026-05-22T00:04:27.198707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It is evaluated with the same system prompt and we extract their answer from the <answer> tag","venue":null,"work_id":"61c509de-2997-45e8-9190-dc52e82ce373","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:caf30b17b01db615ba544acb1a5843ed0e38a6c0894e4662af255294bea7bdfd","observation_id":"1baab14e-7f37-469b-8c05-c5977fccd2cc","resolution":{"observed_at":"2026-05-22T00:04:27.236074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"These methods thus use RLVR model as a generator and their reported accuracies in the result tables are equal","venue":null,"work_id":"0da3bc2a-38b5-461b-9917-0b2eed359669","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:5ed9eb9a027c147a88ba80f01619962537218656acd12f1413a0e770c7c7912d","observation_id":"e8790adc-3959-49af-8ec1-3c92329fef0a","resolution":{"observed_at":"2026-05-22T00:04:27.203831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In case no valid confidence can be extracted, we append ”Thinking time ended","venue":null,"work_id":"fc1a5829-f912-440a-ba27-cfa0a0602b6b","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:2ef502aad7e466801dfbf804ca4884a627b932af6975c54cf9b05388be574a89","observation_id":"e5a7c08c-3abe-49dd-8737-8b2f20eeec97","resolution":{"observed_at":"2026-05-22T00:04:27.231975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d359c9eb-95c0-4a48-968a-0ef4b8222b32","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:df2a31fbf27431507f0e889d60905df9c7682941ae6c399a456536fe0e124f65","observation_id":"e82acdb1-ba53-4d54-8068-740376fcb8d9","resolution":{"observed_at":"2026-05-22T00:04:27.205249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In these cases, It is also okay to have only a small number of uncertainties and then explicitly say that I am unable to spot more uncertainties","venue":null,"work_id":"5f815acb-a643-493d-ab2f-c535bba28179","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:1aeeb57fc2f658108059e302ff9ed108b71e0be2f2bf37064c9c304e081a683e","observation_id":"c86e7345-e35d-4383-8557-2661b07c5196","resolution":{"observed_at":"2026-05-22T00:04:27.222029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For example, uncertainties may arise from ambiguities in the question, or from the application of a particular lemma/proof","venue":null,"work_id":"c7d16df1-dcd2-4482-acea-233c4ecf93ba","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:f8216759bd0a7d72475a9962311e606b1ca6a352e2bddb223de934ec87864d3b","observation_id":"67e414af-44aa-493d-82d1-2b9ae9c4fdec","resolution":{"observed_at":"2026-05-22T00:04:27.219975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad51ae54-5904-4249-899e-d15aba6639a9","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:3f4fa689166e518023d5eccf9904d7395a99ce950f6560f781d04e94f13b6910","observation_id":"50f91763-b8ea-4a38-8fe2-de0ba6de5c6b","resolution":{"observed_at":"2026-05-22T00:04:27.241283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33e7b047-cd67-4e15-9d92-9d735d151082","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:262f04441793cc5d12040eae0ffad2b56a2331c6ed51c236d3adbfcc631f11a8","observation_id":"a503bb22-5eff-4f77-adc8-663850b21d92","resolution":{"observed_at":"2026-05-22T00:04:27.219790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0c696af-d97c-4a0c-80e5-7e61dda867f7","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:3e361a504644e331dfc22d822fe2827d8ef42bc22bb74238d02ec5d4917fd87e","observation_id":"1a2e46e7-ff74-486d-bc34-b0f6ab25489d","resolution":{"observed_at":"2026-05-22T00:04:27.238785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The user asks a question, and the Assistant solves it","venue":null,"work_id":"d632da37-f7ab-4c03-89e5-79e547976bb6","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:dae0e8a4b918761a8c90e24440442e0abf298f8e0c05a80540ae4a8da2b9a8c7","observation_id":"c3db0f85-cc2e-4191-be37-d3ba119522fe","resolution":{"observed_at":"2026-05-22T00:04:27.215250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05997edf-df45-4848-b985-6893cbcac88d","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:92ed6e01285834acbaaadaa810fc043ae02f052808193ca18246fa1fdb3945f0","observation_id":"9280a69c-f8b5-417d-a571-4e62b7671c6b","resolution":{"observed_at":"2026-05-22T00:04:27.217502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"365a3168-c767-440c-9125-9ec9e17bedcb","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:b0cbda561445be728cbed05e401218b0acab948e39d0ed8b05671417fd385cc7","observation_id":"f03f303b-2214-4bff-a1a0-ffd9802c3036","resolution":{"observed_at":"2026-05-22T00:04:27.229613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7462dee8-6268-40c3-8e77-4d62072777e5","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:35c667722ff46d40d3280a72fe820a64b6d139ba6e3bcbd59bc5d220e670c883","observation_id":"3d049dbe-74ba-43c0-b751-ed597040aa68","resolution":{"observed_at":"2026-05-22T00:04:27.240109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"44f3afa0-0e05-434f-8c87-95b02cc66a41","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:0df7d30e948c2b3f78611035b82a7985be3cb561a1dfb0122fd4d1d291e60958","observation_id":"6352271e-cb71-4c5e-af23-c18ad64dcf1d","resolution":{"observed_at":"2026-05-22T00:04:27.236232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e55f91a5-1c76-4df0-af95-3129b4b1ed13","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:74e0f9986c9b1f3c65327003288b5832fefd8ae02b58d7462d7050f6143759cc","observation_id":"48b4a9c2-a80d-4680-884d-9402647e7856","resolution":{"observed_at":"2026-05-22T00:04:27.233763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"21 D R ESULTS D.1 M ODELS TRAINED ON HOTPOT QA Method SimpleQA Trivia Acc","venue":null,"work_id":"6eae963f-ce64-4302-b0bc-a5da28a1bd05","year":2018},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:3443c5147d1f8cee2e070487c1bb3e806d1a94174301b0b8f99a2e411a68e2fc","observation_id":"838f3ddd-94da-4d7e-90eb-ab6dbecb6e56","resolution":{"observed_at":"2026-05-22T00:04:27.238266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d3a3385a-1069-468d-8c56-069ab0c4c6c3","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:f799a185a807a5480c929301cb6a4ce90f9e5e2494990846fef409d084922ecc","observation_id":"d55006d7-f05f-4a62-a4d7-9a304b79927c","resolution":{"observed_at":"2026-05-22T00:04:27.225703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6b2ed1b8-4ebd-4b85-974f-60a761d69e10","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:ecf86b6cf4b6cab67d167580d8e98bc00bd9ada58aac500a7e2e4befbe93172d","observation_id":"3c68983f-6e17-4ccc-a2a3-11e3c4dfbce4","resolution":{"observed_at":"2026-05-22T00:04:27.227713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Bella and Chris watched 2 more movies only with each other","venue":null,"work_id":"2a0e5d0a-39ac-4392-ad15-0614252828b2","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:34a2c71e1bce160fb07abb29faad5943a346f413ff22d6d436cdd2c66c8378cc","observation_id":"de9ab703-b2d2-4b71-a2bd-8b476862419a","resolution":{"observed_at":"2026-05-22T00:04:27.191972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Bella and Chris watching 2 movies only with each other are already subtracted when we subtracted the 5 movies watched together","venue":null,"work_id":"c3b3de01-f632-47ca-bba9-55f899199a48","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:3698775782461fba06d3f17a708c24a83bf31243797fa8f8d0728d38dcad2fe3","observation_id":"53bffd5f-b410-4a8d-bef1-f7a3ce348eaa","resolution":{"observed_at":"2026-05-22T00:04:27.184442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bb02c499-fdb4-4611-b828-2374c63266de","year":null},"citing_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:45.493336Z"},"links":{"citing_paper":"/paper/2507.16806"},"observation_digest":"sha256:6d5315815503fad7188aade34ea1fb53e0ffe40f72bef5b96c15560145fc6016","observation_id":"e3593f54-4b33-4ef6-8eeb-ed207a3bd368","resolution":{"observed_at":"2026-05-22T00:04:27.228379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 23 inbound Pith citation observations for arXiv:2507.16806."}