{"as_of":"2026-08-10T09:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5439f45aa05535bee90d4af5f4c8a432b24730b846831c36de51448be7ec0e56","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:39:15.423614Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02256/citation-record","integrity":"/paper/2507.02256/integrity","json":"/paper/2507.02256/citation-record.json","paper":"/paper/2507.02256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:15.937974Z","title":"grasping","venue":null,"work_id":"b54e0adf-3175-48bd-806b-46b2d910bd51","year":2011},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:15.423614Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:b1caf114a3ba871d649f1e030dbf5fc1378a24075258d1dcc7d75e3450d463f1","observation_id":"3993cf90-b9c6-4592-b88f-ee2c2f36d6c1","resolution":{"observed_at":"2026-08-06T20:39:16.020372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:16.127006Z","title":"(9) By performing coordinate scaling transformation on the sample points, we obtain new sample points p(i) = (˜p(i) 1 /l1,··· , ˜p(i) d /ld), i= 1, 2,··· ,n","venue":null,"work_id":"8a8bee85-c74b-42c9-91ee-7e43a85f9b83","year":2011},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:15.295720Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:6aeb98ca1a140e33125ba51e767e67144b541a22a778586016091660c931d517","observation_id":"701ca3bc-1972-4aff-9005-26a8fc6946d7","resolution":{"observed_at":"2026-08-06T20:39:16.200589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T20:39:13.937399Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.937399Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:d04e8547ab2e017fbf987f55ff7baa7c83234ca45ee6bd33519d54d212975aca","observation_id":"8a56d682-ab05-4f3e-884a-5c185937ea75","resolution":{"observed_at":"2026-08-06T20:39:13.937399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:39:14.052660Z","title":"Generating with confidence: Uncertainty quantification for black-box large language models.Transactions on Machine Learning Research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.052660Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:26ca03c6c4ea162f2cf7c3a12b162e33b5278ec505481c694620a56fe5a5192d","observation_id":"74d66903-5814-4b75-bce6-d39ba09089d6","resolution":{"observed_at":"2026-08-06T20:39:14.052660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:39:14.232861Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.232861Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:6f2d304e9a581ebcadc145c770216896ca1a40571e60181d2560c2080b9b3e87","observation_id":"0365d674-560f-4a63-978f-d41d6024c0c5","resolution":{"observed_at":"2026-08-06T20:39:14.232861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T20:39:14.325053Z","title":"14 Alec Radford, Rewon Child Jeffrey Wu, David Luan, Dario Amodei, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.325053Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:658fefb28b7e0b16fbd66b8cb11821e341df63ebcbb8cc20de2d6070f2545fdd","observation_id":"da250cde-64fe-400e-8ace-fa4420b0013b","resolution":{"observed_at":"2026-08-06T20:39:14.325053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05563","last_updated":"2025-07-01T22:08:39Z","snapshot_observed_at":"2026-07-06T20:03:11.541819Z","submitted_at":"2024-12-07T06:56:01Z","title":"A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05563","snapshot_observed_at":"2026-08-06T20:39:14.548517Z","title":"A survey on uncertainty quantification of large language models: Taxonomy, open research challenges, and future directions.arXiv preprint arXiv:2412.05563,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.548517Z"},"links":{"cited_paper":"/paper/2412.05563","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:e646c2ff49ca8f5c98fecdb5bcf477acabd3c0d8c16f0a0adb590944ca856b5e","observation_id":"3a3d6b55-02b2-4f9b-b2ea-80a85786bd9f","resolution":{"observed_at":"2026-08-06T20:39:14.548517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:16.575989Z","title":"Api is enough: Conformal prediction for large language models without logit-access","venue":null,"work_id":"72f08945-44ad-4eb8-b643-0c3ef0caa183","year":2024},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.711229Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:7a391a6cf9ede3fdc62eabcff4621b962a68ed9dd415ab3cbd4a65e2664202e8","observation_id":"20e09c50-e40b-4152-8b15-49e021975eb7","resolution":{"observed_at":"2026-08-06T20:39:16.664937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T20:39:14.805208Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.805208Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:f6a7d70e7cf193f4f5d435a25dcb17bfb70721a55ee25ac299a57a02a61d1440","observation_id":"9af2285d-9255-47db-b961-bd4976b7c8c9","resolution":{"observed_at":"2026-08-06T20:39:14.805208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:14.898533Z","title":"Do phd-level llms truly grasp elementary addition? probing rule learning vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.898533Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:00a579fa740ce0c4eb9007a79cb01294c55c74409de10434139dacf92c701e3b","observation_id":"bb6c000c-b41b-4496-bf78-f820ad8f56e3","resolution":{"observed_at":"2026-08-06T20:39:14.898533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-08-06T20:39:15.005796Z","title":"Outcome-refining process supervision for code generation.arXiv preprint arXiv:2412.15118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:15.005796Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:dfe5181afe98392648e908a0ab743dfcc0f2ac7a0f0e861ad987fdbb4d801378","observation_id":"52545019-4836-4976-b621-651dc3176642","resolution":{"observed_at":"2026-08-06T20:39:15.005796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-08-07T16:06:17.033571Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-08-06T20:39:15.150337Z","title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:15.150337Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:28109f9984b5a451e7ab730183049fea7016ec519a84cd3fb4449e690ee4dd61","observation_id":"15327041-fc96-46a8-b3bf-afecdf26e69a","resolution":{"observed_at":"2026-08-06T20:39:15.150337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:16.322690Z","title":"The robot must push a movable chair from its initial location to a designated target region","venue":null,"work_id":"97001c2d-6b7b-416d-8f2e-7095cb24a60c","year":2024},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:15.250787Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:28a6ba08d598bc12c932d9aec3b5ded54c639611981cee601ddb30d2d9d0216c","observation_id":"3da67d1c-7edf-438c-b3e6-07fe03250df9","resolution":{"observed_at":"2026-08-06T20:39:16.458326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06687","last_updated":"2023-10-02T17:20:21Z","snapshot_observed_at":"2026-08-03T23:49:55.520138Z","submitted_at":"2023-09-13T02:56:56Z","title":"Self-Refined Large Language Model as Automated Reward Function Designer for Deep Reinforcement Learning in Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06687","snapshot_observed_at":"2026-08-06T20:39:14.628984Z","title":"Self-refined large language model as automated reward function designer for deep reinforcement learning in robotics.arXiv preprint arXiv:2309.06687,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.628984Z"},"links":{"cited_paper":"/paper/2309.06687","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:7418b96ff2e36148631305b69b0869af02a5dbf8e44a1dd19d91e472b2bafd69","observation_id":"85bba71d-bfa2-4543-b947-d32463ec5e82","resolution":{"observed_at":"2026-08-06T20:39:14.628984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:17.097640Z","title":"A survey of confidence estimation and calibration in large language models","venue":null,"work_id":"1363e913-3e3f-4b23-a9c1-dd75d95721fd","year":2024},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.659017Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:c38736e7e86786e420f5f52db88b0252674c1073bd9f45a31503ac86c2d6134a","observation_id":"f8f18e13-f230-4c90-a7b1-85703a47297b","resolution":{"observed_at":"2026-08-06T20:39:17.193725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:16.761643Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":"861cfddf-4272-4274-a4a5-472c053e511e","year":2023},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.726804Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:0af749107d32b135e524b11bb087fdbe092c8321acb2b4f37458dfb387d4dcba","observation_id":"353afe68-687c-4b83-b7af-acde704e0299","resolution":{"observed_at":"2026-08-06T20:39:16.938341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T20:39:14.376825Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.376825Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:cbf1772229eaa691dd9a6b173df755ebfd6d4695d9393f4ca78249bf5444bc48","observation_id":"38ee5e0b-970b-44c7-9c04-a379d987b780","resolution":{"observed_at":"2026-08-06T20:39:14.376825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-06T20:39:13.455724Z","title":"V-jepa 2: Self-supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.455724Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:971a47058d9a6460176ba22da2c733c38b7b8376be4752fcc5661dfa529ebeed","observation_id":"11d557d8-f6ab-4da4-96a2-e659eeccefa3","resolution":{"observed_at":"2026-08-06T20:39:13.455724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15652","last_updated":"2025-07-21T01:15:52Z","snapshot_observed_at":"2026-08-10T08:45:30.428256Z","submitted_at":"2025-02-21T18:20:35Z","title":"Empowering LLMs with Logical Reasoning: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15652","snapshot_observed_at":"2026-08-06T20:39:13.583068Z","title":"Empowering llms with logical reasoning: A comprehensive survey.arXiv preprint arXiv:2502.15652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.583068Z"},"links":{"cited_paper":"/paper/2502.15652","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:dfd0c968e6f1f8f35550481ae1dd49007c5351c2e76962f6dd90a0d3676934d8","observation_id":"e1752300-b526-4ae2-bda8-21ce563c48ec","resolution":{"observed_at":"2026-08-06T20:39:13.583068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-06T20:39:13.821156Z","title":"Language models (mostly) know what they know","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.821156Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:d65a10c7d90f1f2bf22001bd94edd0dc36b509e7fc032a5ba8eb3d765af0ba0f","observation_id":"c063a9bb-689b-4bee-af8f-8e9c0d992ba0","resolution":{"observed_at":"2026-08-06T20:39:13.821156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15850","last_updated":"2025-06-03T22:16:32Z","snapshot_observed_at":"2026-08-07T16:50:07.430220Z","submitted_at":"2025-03-20T05:04:29Z","title":"Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15850","snapshot_observed_at":"2026-08-06T20:39:14.125605Z","title":"Uncertainty quantification and confidence calibration in large language models: A survey.arXiv preprint arXiv:2503.15850,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:14.125605Z"},"links":{"cited_paper":"/paper/2503.15850","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:e39301ad7a984c37806be99cb0a94c33592406759e4555eeca14d33640523316","observation_id":"76f56745-1708-4541-bf02-82be042d9954","resolution":{"observed_at":"2026-08-06T20:39:14.125605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:17.267868Z","title":null,"venue":null,"work_id":"aeda6cf2-d378-4c1d-9d3a-9fc252a5df78","year":1901},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:13.515501Z"},"links":{"citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:7e5509cd400cbdf30f6ae2f44acaa2609c4b91bda511af425367f91828ef90a8","observation_id":"d9bca7eb-d4c8-4946-91a0-eb3102484ed8","resolution":{"observed_at":"2026-08-06T20:39:17.365294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:31:32.680778Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.02256."}