{"as_of":"2026-08-08T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:903c958961365a82f83dd2886e6bc2536058070d02ba80c4c0d9ddfd79f98a1f","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:54.646894Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:10:40.020460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T03:55:53.842268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2505.23540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23540","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Probability-consistent preference optimization for enhanced llm reasoning","venue":null,"work_id":"457d6359-ad68-4074-84bf-87ec972e4403","year":2025},"citing_paper":{"arxiv_id":"2605.07353","last_updated":"2026-05-08T07:08:25Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:08:25Z","title":"Confidence-Aware Alignment Makes Reasoning LLMs More Reliable","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:40.020460Z"},"links":{"cited_paper":"/paper/2505.23540","citing_paper":"/paper/2605.07353"},"observation_digest":"sha256:a4c8573e5e15e930258ea7fea76124df784b8450a0be644b485ff38d338c8b0e","observation_id":"704f80b4-7721-4f40-80da-ebb3b85067ed","resolution":{"observed_at":"2026-05-11T03:55:53.845454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23540/citation-record","integrity":"/paper/2505.23540/integrity","json":"/paper/2505.23540/citation-record.json","paper":"/paper/2505.23540"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:46.753612Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:46.753612Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:7733ecc7ed06b534e3a5ce363699a04c25018b422a0bb3344f889435e5aad61a","observation_id":"6d0201b1-c789-4d40-a1b8-4531e2a509e7","resolution":{"observed_at":"2026-08-07T12:48:46.753612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:46.884044Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:46.884044Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:662faec24301d5bdfbe9fa0d84583d02b41a3ea663b164e11dfe698ea43bab33","observation_id":"b9fa71cd-82ec-4690-a49a-03bb98b80ddd","resolution":{"observed_at":"2026-08-07T12:48:46.884044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-03T23:38:38.676420Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-08-07T12:48:47.051024Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:47.051024Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:59a701cea4c964086b0fcfba69cd5f01fd4d0d5cc4335b863358abdcbf3c7d11","observation_id":"2cc13414-55b7-4a9c-abf4-e85bea0b9a3f","resolution":{"observed_at":"2026-08-07T12:48:47.051024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T12:48:47.263325Z","title":"Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:47.263325Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:f82d06947d942f20292f9e0c6f0cc6db3d4efafe5081c422d8cb947fa99269a4","observation_id":"f36448ab-9dbb-470e-bfb2-1ce6b9b67b6e","resolution":{"observed_at":"2026-08-07T12:48:47.263325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:47.435160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:47.435160Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:cbba7bccbb97fa8daa79b7c728bb85f5aace1900af219d92eede8e5a9e075ec1","observation_id":"ae85c740-cb08-4a98-8fe2-77b25cb86a95","resolution":{"observed_at":"2026-08-07T12:48:47.435160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:47.525774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:47.525774Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:a223345932d2acd750c3c027f23c031bc7dcbe9389ae3f1e7216ae340e93d914","observation_id":"0a5a5b99-02cb-4289-8626-cc777c298547","resolution":{"observed_at":"2026-08-07T12:48:47.525774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T12:48:47.699588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:47.699588Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:3a9da4e1e07e94d2fffda77ff09213874bdf8d168c09e7c74fdef4cf9702a217","observation_id":"c877b047-7045-4853-8417-22c2d296aa21","resolution":{"observed_at":"2026-08-07T12:48:47.699588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T12:48:47.872992Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:47.872992Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:628fd5ac8dfa0adac20b2061aa838f0e9dd7584b7bfad9569ed27693387e27f5","observation_id":"f0670dc0-94b8-41d2-b2bb-c56c94912132","resolution":{"observed_at":"2026-08-07T12:48:47.872992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:48.005985Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.005985Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:145d210b4f16aa3e86467aee637d4bbd9aadbfc689641ad207e0deef948fdf2e","observation_id":"4e73070a-331a-475f-9fac-195c6406a8e9","resolution":{"observed_at":"2026-08-07T12:48:48.005985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:48.128007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.128007Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:7d35dbe6186db7fee9d06b9f2f49da531920b37bb48bdef5dc35f66fdedda8d2","observation_id":"789ab79c-abe2-4128-a481-15da00115460","resolution":{"observed_at":"2026-08-07T12:48:48.128007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:48:48.284922Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.284922Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:aedf1f4fd0f1b8ba8e96826a155b840f0c04560c1efbc18834793d418b0b01f9","observation_id":"04de3fd1-ae6a-4501-9a81-4e0544bd0d13","resolution":{"observed_at":"2026-08-07T12:48:48.284922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:48:48.497500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.497500Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:7e7f72927102680fbcf58791e61a1ff4168598f853bf6ff8361a7a8ded0db5a9","observation_id":"fe43d705-b098-4d91-80cc-20a738956ba7","resolution":{"observed_at":"2026-08-07T12:48:48.497500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.493820Z","title":"u rnkranz and Eyke H \\","venue":null,"work_id":"b4e20739-32f9-4a41-a5c7-9dd38919bba5","year":2010},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.600730Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:36cf29d9ea8a9e6724c7f44c4f57751696d32d2e095291e42f1253e9fd75df0d","observation_id":"5d37c2cb-3193-40da-84b9-393519fa4a1a","resolution":{"observed_at":"2026-08-07T12:48:56.641896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01720","last_updated":"2025-02-06T06:42:17Z","snapshot_observed_at":"2026-08-08T18:54:47.795924Z","submitted_at":"2024-10-02T16:32:05Z","title":"Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01720","snapshot_observed_at":"2026-08-07T12:48:48.773375Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.773375Z"},"links":{"cited_paper":"/paper/2410.01720","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:6c44e01d0a27f16e4a58fb5a175e01c7e7fb1f8536e93e8357a942b378933295","observation_id":"9ed398c0-88ae-4c62-87ff-d30bc9adbbb4","resolution":{"observed_at":"2026-08-07T12:48:48.773375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T12:48:48.941524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:48.941524Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:f66f9b0d5dbc0eb7e510aaef23e9dad9e35b91b1fb89d734fbca052226e17970","observation_id":"807d9afd-850a-474e-a795-f9013df45462","resolution":{"observed_at":"2026-08-07T12:48:48.941524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.322306Z","title":null,"venue":null,"work_id":"b328960d-793f-46e0-b06e-31ca3fc0bfe8","year":2004},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.082974Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:bfa35e9204a10b4ed734df231777ef69062c8f6b5bdf333e008d8e64f5d703af","observation_id":"1d2b6096-c2c2-44ea-bb5f-f08a890ccb5d","resolution":{"observed_at":"2026-08-07T12:48:56.412047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T12:48:49.267026Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.267026Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:65426e8ad8f69ce25cc8ce099e3dcc5e064f063ee8080cddd2183131cadedb18","observation_id":"c0be4535-8a3f-4e1d-ba62-e0be2797985c","resolution":{"observed_at":"2026-08-07T12:48:49.267026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:56.093280Z","title":null,"venue":null,"work_id":"093c9c5f-2c5e-4153-9c17-f2cdf8aecef3","year":1955},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.366558Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:5b57c23c614093ee1642a4a8d3fb90ba2c693a7bf57e5773b52403a8568d813c","observation_id":"971a7edd-e295-4cbe-977c-2b9e0b5e304a","resolution":{"observed_at":"2026-08-07T12:48:56.170201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-07T12:48:49.542632Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.542632Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:e30678287a843064511d8f5221e5550b7efeeb999dd3d774b67ec16ae283b017","observation_id":"9a896b54-0054-41d1-b37b-f21852b92d9d","resolution":{"observed_at":"2026-08-07T12:48:49.542632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:49.764910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.764910Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:d265274499368a2ce01dab3f9caff5d49cff3c110335b763d770614063e86e09","observation_id":"aa60184e-e272-4d86-8765-02f23d4f1a18","resolution":{"observed_at":"2026-08-07T12:48:49.764910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T12:48:49.921998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:49.921998Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:1423fb251a7abee1e6aed4c7ade4957366abeb153f812113e23234bff6cf9b88","observation_id":"8589f443-2d0a-49af-a999-e6da8d773234","resolution":{"observed_at":"2026-08-07T12:48:49.921998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T12:48:50.073075Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.073075Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:e307967769612bea7cd2d31c654f1264ccbbba8c8dcb273811da04829dd04079","observation_id":"e39e65c4-b8a8-4410-93bd-1a9090af818b","resolution":{"observed_at":"2026-08-07T12:48:50.073075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T12:48:50.236031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.236031Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:70448ca76f630b2c0df2bee825562790dafc70e39101c1e1cd14bb85494cc019","observation_id":"a93cddcb-a3e8-4f57-ab22-35ccfae51949","resolution":{"observed_at":"2026-08-07T12:48:50.236031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.415748Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.415748Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:82d5b28a976e36a05e4eb711c19092d974c911e6de98541d2e6e601786a1fb2d","observation_id":"5d64946e-9d68-4229-a38a-d70737774dfe","resolution":{"observed_at":"2026-08-07T12:48:50.415748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:55.776784Z","title":null,"venue":null,"work_id":"ab9a8651-2a0b-4fd4-ab82-9b1b9eb857ac","year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.526871Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:7b4725823b80f8e4174c4c5df6b58ec97df697c8cccbb4be9498746b82e55198","observation_id":"c18b59a3-11d1-4f60-a310-2f278c5be249","resolution":{"observed_at":"2026-08-07T12:48:55.896260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T12:48:50.661025Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.661025Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:409e3f30a00e2eab4a12efe1093b0ca2c7fa55b767962cdc023beef9ec4fbae0","observation_id":"25372d40-7a3c-47c2-9c23-05b9270628b4","resolution":{"observed_at":"2026-08-07T12:48:50.661025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-07T08:00:00.868748Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-07T12:48:50.753591Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.753591Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:13e1c028ddd9fbdbb0968595ce8d156d9feb5a108544a723adeb0c734776bfc2","observation_id":"4088bc24-c3d9-4787-8e90-48c51ab95d93","resolution":{"observed_at":"2026-08-07T12:48:50.753591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-08T04:33:50.104780Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19943","snapshot_observed_at":"2026-08-07T12:48:50.846271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.846271Z"},"links":{"cited_paper":"/paper/2411.19943","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:ba4417afacf1183480dc3569962b81e74eb068bea702f2414db2e7c540a99bd9","observation_id":"4dc331b4-4341-4494-8e12-08eb8254157a","resolution":{"observed_at":"2026-08-07T12:48:50.846271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:55.592309Z","title":null,"venue":null,"work_id":"7b4843d5-6c7a-442e-90b1-25a5e9be1265","year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:50.956262Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:4da6606ae8ff8875b8b734100d91d516be6d644c32180b20281e349c4419c221","observation_id":"68230bdb-df1b-4f35-9f3e-b72edb08be27","resolution":{"observed_at":"2026-08-07T12:48:55.654117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09479","last_updated":"2024-05-13T01:25:12Z","snapshot_observed_at":"2026-08-06T14:28:32.497451Z","submitted_at":"2023-06-15T20:11:23Z","title":"Inverse Scaling: When Bigger Isn't Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09479","snapshot_observed_at":"2026-08-07T12:48:51.113697Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.113697Z"},"links":{"cited_paper":"/paper/2306.09479","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:ecf151d5334c7ed5d2ba1b0efd4f4a5744c1b0e6ae5704250ee68ee36015c8df","observation_id":"3dc8d264-c4ac-4339-a805-f8f2b22d8a18","resolution":{"observed_at":"2026-08-07T12:48:51.113697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-07T12:48:51.344663Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.344663Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:e4d3d3aa0ec433d2d28d52dd5be53fee404f9f6157eda906d4b0e7a3e5b685cf","observation_id":"292d24a2-6db8-4036-bb00-29d468322805","resolution":{"observed_at":"2026-08-07T12:48:51.344663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:48:51.544455Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.544455Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:c30fc5e7105d12062a0f8837fd3fdd8875978041ae7379c5018bc6ddb7150784","observation_id":"84a2e209-521b-4d8d-8071-a0a6fea3e594","resolution":{"observed_at":"2026-08-07T12:48:51.544455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:51.715839Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.715839Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:2047959d3d697f075b388c53b137f26c91e170d3858078a2b149e9dd03889de4","observation_id":"f24bd252-aa67-4027-9ffe-31d4bcb8ed9d","resolution":{"observed_at":"2026-08-07T12:48:51.715839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-07T12:48:51.881145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.881145Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:4d504788a546fd80e885eba1b68b58f5c24ca0414227c3c8177cff34313ff1ce","observation_id":"6b8c74b3-c7d2-4fd9-9fa0-e88b8aaf2d78","resolution":{"observed_at":"2026-08-07T12:48:51.881145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04109","last_updated":"2025-07-06T18:16:47Z","snapshot_observed_at":"2026-07-06T19:46:15.364468Z","submitted_at":"2024-11-06T18:36:22Z","title":"Self-Consistency Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04109","snapshot_observed_at":"2026-08-07T12:48:52.028303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.028303Z"},"links":{"cited_paper":"/paper/2411.04109","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:a38095f4f3a2c01189c238a1045cc418841c569f5ee0a9ed975b4f935d22afe4","observation_id":"7c5d64e3-bd74-4310-87b3-46498df3ea7f","resolution":{"observed_at":"2026-08-07T12:48:52.028303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:52.236313Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.236313Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:d9cbdd2b0650f8af633e0d348d485700c614bb0dee3aabd372bf6615d2c8529c","observation_id":"63350242-06bc-4505-9b17-e3593cbb3996","resolution":{"observed_at":"2026-08-07T12:48:52.236313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:52.442199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.442199Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:a061fc5c445cac61c8cd5425c307d477b49e3e4f5b2e2a5ff2f28e0b70bf7d9f","observation_id":"5d901273-a9c0-4812-90d3-7e8131a2b228","resolution":{"observed_at":"2026-08-07T12:48:52.442199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:52.594267Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.594267Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:d5f4856fd841173172ff2f219793e901bcb1db1af1e5adceee7149fd68256065","observation_id":"2a5a65b9-8bbd-4185-9e6d-cf89e8a9d320","resolution":{"observed_at":"2026-08-07T12:48:52.594267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:48:52.739102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.739102Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:f43453e7aeeca6a947a4d9b2e3d06d56c611304374d97d4c0f80da1d074c27b9","observation_id":"5628600a-17b9-4f11-9666-e7cf21c8ed3f","resolution":{"observed_at":"2026-08-07T12:48:52.739102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:48:52.883958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:52.883958Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:94714bb6e7fe645137c8213938a279d2a31c967bd43b2d46d41bea751913deed","observation_id":"a53b2819-2362-4d2d-917a-ff8642221b71","resolution":{"observed_at":"2026-08-07T12:48:52.883958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.070330Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.070330Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:fea25b63171a05e8883e8847d55237a4d0fc45aa6d0295301579afb8a3a45bd2","observation_id":"e459c472-4f91-4d75-b669-3e9993087f5c","resolution":{"observed_at":"2026-08-07T12:48:53.070330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04503","last_updated":"2024-10-06T14:48:28Z","snapshot_observed_at":"2026-08-07T09:17:14.237904Z","submitted_at":"2024-10-06T14:48:28Z","title":"LRHP: Learning Representations for Human Preferences via Preference Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04503","snapshot_observed_at":"2026-08-07T12:48:53.221253Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.221253Z"},"links":{"cited_paper":"/paper/2410.04503","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:d76972a2287d09a3888daced1104c1b7f0bb70f627a2fd6c5e044fdda13c9abc","observation_id":"a118128f-1d83-4816-a98b-b1ee6b2c5513","resolution":{"observed_at":"2026-08-07T12:48:53.221253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T12:48:53.362214Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.362214Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:24d2c8ff2a81a05a939522e605bf0159689bec6bfbf05d5cb878533c9d890cdd","observation_id":"ccea8820-6185-4dab-846f-fe5503aacfb9","resolution":{"observed_at":"2026-08-07T12:48:53.362214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02492","last_updated":"2020-10-02T22:36:49Z","snapshot_observed_at":"2026-08-08T17:50:36.881881Z","submitted_at":"2020-02-06T19:56:15Z","title":"Consistency of a Recurrent Language Model With Respect to Incomplete Decoding","version":2},"cited_work":{"arxiv_id":"2002.02492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.02492","snapshot_observed_at":"2026-08-07T12:48:54.899558Z","title":"Consistency of a Recurrent Language Model With Respect to Incomplete Decoding","venue":"cs.LG","work_id":"605a12c7-5ccf-4c7b-b8de-913331896948","year":2020},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.508094Z"},"links":{"cited_paper":"/paper/2002.02492","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:0c2c64f89116bcceebd140b7ec60689c724409b6b864b00b698e39da9a6e1f9c","observation_id":"7009d628-dde1-4970-b138-c3801022ed5d","resolution":{"observed_at":"2026-08-07T12:48:55.005187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:55.331869Z","title":null,"venue":null,"work_id":"b31c54b1-97ad-487e-abf3-6179d2451b0b","year":2017},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.657068Z"},"links":{"citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:1b6ff154b9aab4ae53d4fd10911302e6352deb60e86a1a8c1820aad36ac5e7a6","observation_id":"6261dd51-e4f9-4d11-89b5-626a1f7d92d9","resolution":{"observed_at":"2026-08-07T12:48:55.456689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T12:48:53.850737Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.850737Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:7fc00b64926ffa5253bea48ddd579029dc872a103fd82eb3f835542e7c7d4613","observation_id":"fcbbe315-6b07-4e8d-be48-ea0ba4728290","resolution":{"observed_at":"2026-08-07T12:48:53.850737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:48:53.971380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:53.971380Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:50535cdf2619a3d5cfa652d38f808cd405f6925e88946536a0fe1e74417137c2","observation_id":"0cc5b074-990d-47eb-8731-df040fe7866f","resolution":{"observed_at":"2026-08-07T12:48:53.971380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:48:54.069667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.069667Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:69d85e4beb70317ad965e22873c433d0b2f95b3d10ecd15f73cf01c9cb28f70c","observation_id":"12fac24c-5d97-4132-8ce7-02079af468ed","resolution":{"observed_at":"2026-08-07T12:48:54.069667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T12:48:54.203982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.203982Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:f96ee7ad8ef4a6ef56aa7ebc86d35d608c27c9f523623871e1a985f928071a1b","observation_id":"0c0ef65f-e24d-4869-a4bc-854791757086","resolution":{"observed_at":"2026-08-07T12:48:54.203982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12950","last_updated":"2024-03-16T04:22:09Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:23:22Z","title":"RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12950","snapshot_observed_at":"2026-08-07T12:48:54.380705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.380705Z"},"links":{"cited_paper":"/paper/2307.12950","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:e9e9f32807fc7dd3af92c1b1230a8b4d33854d92441256327c995138ea9bf5e0","observation_id":"37060bab-bcc1-490a-83ca-f6405add8166","resolution":{"observed_at":"2026-08-07T12:48:54.380705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-07T12:48:54.498345Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.498345Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:dec34ad1acab8394dfd48ee991f5607602a93eeddc4cf1749cd2d78a59bd944a","observation_id":"ca19ee2c-5fa0-44d7-a150-b0197044a3a3","resolution":{"observed_at":"2026-08-07T12:48:54.498345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-07T12:48:54.646894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.646894Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:d21ac77bbded77fcc64de2f1b2ddb261c2aaf2734ffdee9a70d1944403adf3cc","observation_id":"8cc37db7-4a5c-40ce-99ae-84eaceba409b","resolution":{"observed_at":"2026-08-07T12:48:54.646894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:34:56.721276Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2505.23540."}