{"as_of":"2026-08-14T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bd3b4b2c56eed62ba3ac18dce738d1819779dcfb55c4d0993252bf5d2e3c8c1","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:34:30.811523Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:53:26.423440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22648","snapshot_observed_at":"2026-08-04T00:53:26.423440Z","title":"2601.22648 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00301","last_updated":"2026-07-31T21:31:07Z","snapshot_observed_at":"2026-08-10T19:46:27.049643Z","submitted_at":"2026-07-31T21:31:07Z","title":"Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T00:53:26.423440Z"},"links":{"cited_paper":"/paper/2601.22648","citing_paper":"/paper/2608.00301"},"observation_digest":"sha256:aa95d4bfd02bd091634957b1e252b08d71abfe7f9895818ff22e56a4b373a06f","observation_id":"04ea5d40-19af-43f6-9220-e1a19046f1ea","resolution":{"observed_at":"2026-08-04T00:53:26.423440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.22648/citation-record","integrity":"/paper/2601.22648/integrity","json":"/paper/2601.22648/citation-record.json","paper":"/paper/2601.22648"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.13275","last_updated":"2024-01-28T09:07:13Z","snapshot_observed_at":"2026-08-13T04:35:46.259672Z","submitted_at":"2024-01-24T07:34:55Z","title":"Can AI Assistants Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13275","snapshot_observed_at":"2026-08-03T06:34:28.294064Z","title":"Can ai assistants know what they don’t know?arXiv preprint arXiv:2401.13275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.294064Z"},"links":{"cited_paper":"/paper/2401.13275","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:8cc8306416dadcffe6afc392113c20c4de6b3080cc9af1a3b52e8dac7c5d03f7","observation_id":"605cee2b-5d16-4dd8-a92a-4627b74bb8a4","resolution":{"observed_at":"2026-08-03T06:34:28.294064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:34:28.517291Z","title":"P., Leang, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.517291Z"},"links":{"citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:835855016fc1cfce6b4c1cb91dc81381efa37dbdccaf92f32abeb27436c344fa","observation_id":"f08f8c32-e2bf-4d9c-9b88-cbc0581a328c","resolution":{"observed_at":"2026-08-03T06:34:28.517291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T06:34:28.636359Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.636359Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:8fa07885c579c5fec52e7a14df34348fd66f723dfbb8d645e6c56dfe8e77ac55","observation_id":"2bfdbc99-18c0-4f95-a941-a488fd05861a","resolution":{"observed_at":"2026-08-03T06:34:28.636359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-03T06:34:28.805851Z","title":"A survey on hallucination in large language models: Princi- ples, taxonomy, challenges, and open questions.ArXiv, abs/2311.05232,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.805851Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:666078125e487057cab79e6e8f9fce34a44f187af2ca66231986a2ec41038f3c","observation_id":"9a0799e2-24c9-451e-aca2-6aea9e1a51c1","resolution":{"observed_at":"2026-08-03T06:34:28.805851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-13T13:49:09.715847Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09038","snapshot_observed_at":"2026-08-03T06:34:29.025920Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.025920Z"},"links":{"cited_paper":"/paper/2506.09038","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:6b3de15028d31f8b58b20f0a04b1faf412173b7446f56eac05293dc2e3cfdb9b","observation_id":"3f5763b8-3ec8-4ab1-b481-419230e41fb2","resolution":{"observed_at":"2026-08-03T06:34:29.025920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-03T06:34:29.146626Z","title":"From system 1 to system 2: A survey of reasoning large lan- guage models.arXiv preprint arXiv:2502.17419,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.146626Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:643be6c9e9dce32fd8a293070e62ed08cd0dadf7df98a49d45ecd8dead172325","observation_id":"1433b8d9-02b1-41e6-b1de-b3e4e5bccc9c","resolution":{"observed_at":"2026-08-03T06:34:29.146626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-03T06:34:29.264212Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.264212Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:e38005a0ad9b91a5b93f94d5de58b9b085fb8a0aeafc456fd1f3823ddaa749ad","observation_id":"2e745608-7062-4f9c-9a11-36c004a8b6e0","resolution":{"observed_at":"2026-08-03T06:34:29.264212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:34:29.435633Z","title":"Ngrpo: Negative-enhanced group relative policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.435633Z"},"links":{"citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:93cb75576d897f1160b8e66efdbb9742dac8d16a08ae45f1679ba26bcdea95fa","observation_id":"8e437aee-a72b-487d-82e5-b4de3f4fa9b4","resolution":{"observed_at":"2026-08-03T06:34:29.435633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19807","last_updated":"2026-04-16T16:50:02Z","snapshot_observed_at":"2026-07-06T21:47:01.972372Z","submitted_at":"2025-06-24T17:17:17Z","title":"KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19807","snapshot_observed_at":"2026-08-03T06:34:29.551730Z","title":"Knowrl: Exploring knowledgeable reinforcement learn- ing for factuality.arXiv preprint arXiv:2506.19807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.551730Z"},"links":{"cited_paper":"/paper/2506.19807","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:61179405fe098310fe6eabcd12a11c985f6ee983309cfd0326a41f8be9c9789e","observation_id":"7f512ed6-ca9a-47d8-b001-8db8599267b7","resolution":{"observed_at":"2026-08-03T06:34:29.551730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T06:34:29.722785Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.722785Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:d1b21c185b842ae21256f859ee4155391dca238d4372a44fdb36e826697cde6e","observation_id":"d913b11d-0938-4f15-8e1b-9f467c2fb888","resolution":{"observed_at":"2026-08-03T06:34:29.722785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11877","last_updated":"2023-11-12T13:14:36Z","snapshot_observed_at":"2026-08-13T05:46:57.415602Z","submitted_at":"2023-10-18T11:01:09Z","title":"The Curious Case of Hallucinatory (Un)answerability: Finding Truths in the Hidden States of Over-Confident Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11877","snapshot_observed_at":"2026-08-03T06:34:29.871108Z","title":"The curious case of hallucinatory (un) answerability: Finding truths in the hidden states of over-confident large language models.arXiv preprint arXiv:2310.11877,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.871108Z"},"links":{"cited_paper":"/paper/2310.11877","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:a5f495157a4706446d7a0d71f9b40211296d5f58d9c22a800260e9913e0f53f8","observation_id":"64dbf637-8191-4b22-85b7-eb138f78bc3b","resolution":{"observed_at":"2026-08-03T06:34:29.871108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-13T11:34:39.120541Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-03T06:34:29.961428Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.961428Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:633dcdf586557924e78ecf87a92c87e2e6b6175a30cd5d4ebcc0ef17237529f0","observation_id":"07c74a56-30da-4241-acee-22357dc2f946","resolution":{"observed_at":"2026-08-03T06:34:29.961428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01313","last_updated":"2024-01-08T16:19:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T17:56:30Z","title":"A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01313","snapshot_observed_at":"2026-08-03T06:34:30.049121Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.049121Z"},"links":{"cited_paper":"/paper/2401.01313","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:670b30f57bc041f9f563f467c25158db438fa79e2b72d0da7915d7654368e0eb","observation_id":"1e4f6dad-c23b-476e-ba13-b9f248222e08","resolution":{"observed_at":"2026-08-03T06:34:30.049121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25760","last_updated":"2026-06-08T21:01:17Z","snapshot_observed_at":"2026-08-04T13:43:30.594965Z","submitted_at":"2025-09-30T04:25:17Z","title":"TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25760","snapshot_observed_at":"2026-08-03T06:34:30.106787Z","title":"Truthrl: Incentivizing truthful llms via reinforcement learning.arXiv preprint arXiv:2509.25760,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.106787Z"},"links":{"cited_paper":"/paper/2509.25760","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:05bfd7cd880b166866cae5bd9a3be05c9d5f3c810423c1dab4dd938f219f1b73","observation_id":"fcdef762-0f6d-4e7e-9436-2447783ee2f1","resolution":{"observed_at":"2026-08-03T06:34:30.106787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T06:34:30.194123Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.194123Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:309d230c15696badc41b267530dd22d183879328e87e9659994f96329c4c147c","observation_id":"eb98981a-90d9-46d3-9781-ae595a09064b","resolution":{"observed_at":"2026-08-03T06:34:30.194123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-09T17:49:59.281910Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23646","snapshot_observed_at":"2026-08-03T06:34:30.368552Z","title":"Are reasoning models more prone to hallucination?arXiv preprint arXiv:2505.23646,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.368552Z"},"links":{"cited_paper":"/paper/2505.23646","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:9161d95382314345276983e2951e8b9c1cf5a3c25af00eab5e67f6ca14220248","observation_id":"e50f1400-c5c4-46d5-b9ce-6c0a75ab3b27","resolution":{"observed_at":"2026-08-03T06:34:30.368552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T06:34:30.480875Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.480875Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:7ab7897c5169199b62c5d20f568ef4b91dcde064e7240bf693ab9cb410b1a0c4","observation_id":"2a99d227-4845-400c-9cff-f203d2bd8138","resolution":{"observed_at":"2026-08-03T06:34:30.480875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-03T06:34:30.657970Z","title":"A survey of reinforcement learning for large reasoning models.arXiv preprint arXiv:2509.08827,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.657970Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:d350b640ab92be4b7f467cf4195c581439a04bd4010c908426c0ae04ca5d9139","observation_id":"fd895313-c23f-4a69-9839-681b8117a878","resolution":{"observed_at":"2026-08-03T06:34:30.657970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:34:30.761063Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.761063Z"},"links":{"citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:e6a38b85c4ca984a3bbffbac68445cf92ba0b9d7a496910bc95b717a52330f16","observation_id":"02ba818f-c56b-4a58-8fbd-706e647ed6de","resolution":{"observed_at":"2026-08-03T06:34:30.761063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:34:30.811523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:30.811523Z"},"links":{"citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:bdb9466d18475aeb1551fbd72e4703fe2a9208b4b26e99593ad207efc3860e7f","observation_id":"c406dff7-26fb-4c27-9210-3e12085cd10e","resolution":{"observed_at":"2026-08-03T06:34:30.811523Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-08-13T11:47:28.807684Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-03T06:34:28.912210Z","title":"T., Nachum, O., Vempala, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.912210Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:75e561938cb610c5f05eb5f52daf1993813e3b78c0455e0e71c9fd9ae8a8eed9","observation_id":"6adc291c-0df8-4ef8-b116-c208dc6c6f34","resolution":{"observed_at":"2026-08-03T06:34:28.912210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:34:28.169956Z","title":"Amayuelas, A., Wong, K., Pan, L., Chen, W., and Wang, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.169956Z"},"links":{"citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:71e7c53a488d6194331e374939cdaec04d2a5b2705fb8f22f702e229022261f1","observation_id":"d2709e7c-1776-4bb1-b3f9-9ed4a1d765db","resolution":{"observed_at":"2026-08-03T06:34:28.169956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01781","last_updated":"2025-08-03T14:37:16Z","snapshot_observed_at":"2026-08-13T02:38:43.504291Z","submitted_at":"2025-08-03T14:37:16Z","title":"A comprehensive taxonomy of hallucinations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01781","snapshot_observed_at":"2026-08-03T06:34:28.406600Z","title":"org/abs/2508.01781","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:28.406600Z"},"links":{"cited_paper":"/paper/2508.01781","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:f251419878563abd7ad65dcb06e1019bc7a1ddb00884367697ed75d3923e0e05","observation_id":"adc8f792-31ba-44bb-9ac5-11f2f93e7534","resolution":{"observed_at":"2026-08-03T06:34:28.406600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T21:15:46.629921Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2601.22648."}