{"as_of":"2026-08-09T12:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d621dfb2e57eccc27e5be07bf34a3f6f2c1c907471632f7f508e5e3f8b9912f","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:10:53.458422Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.05773/citation-record","integrity":"/paper/2502.05773/integrity","json":"/paper/2502.05773/citation-record.json","paper":"/paper/2502.05773"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.04166","last_updated":"2025-03-07T10:51:04Z","snapshot_observed_at":"2026-08-08T12:24:13.216966Z","submitted_at":"2024-10-05T14:04:03Z","title":"Learning from negative feedback, or positive feedback or both","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04166","snapshot_observed_at":"2026-08-08T18:10:53.340865Z","title":"T., Hertweck, T., Joshi, R., Oh, J., Bloesch, M., Lampe, T., Heess, N., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.340865Z"},"links":{"cited_paper":"/paper/2410.04166","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:8de33c452b9cfc8117802f2a12535d80e2bc6e1d60b32f70aa9f70589b0243da","observation_id":"a869fe09-2ea4-4a9f-a322-c1eff8008cb4","resolution":{"observed_at":"2026-08-08T18:10:53.340865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-08T14:49:36.757543Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-08T18:10:53.351858Z","title":"Alphamath almost zero: process supervision without process","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.351858Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:98459bd3e7911db3926105f8118b7a5616c3efcfe22a657127b8c0e1d1fec1bc","observation_id":"db981569-bbae-4bbb-9a6c-4b523ed8decb","resolution":{"observed_at":"2026-08-08T18:10:53.351858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T18:10:53.358850Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.358850Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:429ea20ba9820e0eb683491402fa907f590c493745991264b663123411646513","observation_id":"1c8db598-fd29-4a54-ac1d-4ffa02a74aa8","resolution":{"observed_at":"2026-08-08T18:10:53.358850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14115","last_updated":"2024-01-10T16:11:32Z","snapshot_observed_at":"2026-07-06T16:51:40.320710Z","submitted_at":"2023-11-23T17:20:36Z","title":"A density estimation perspective on learning from pairwise human preferences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14115","snapshot_observed_at":"2026-08-08T18:10:53.362923Z","title":"D., Castro, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.362923Z"},"links":{"cited_paper":"/paper/2311.14115","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:dfc3b193c828a1874ebc6923fe27a64fccdfdd8ef70cd87b761e1db730299a07","observation_id":"bfb4e99f-bfdf-4464-8ff4-4f5022b07e01","resolution":{"observed_at":"2026-08-08T18:10:53.362923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-08T18:10:53.366395Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.366395Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:bed43bafab6c53818fb3101c862da02b5527e4c8f117f6d3b7e3050c443ed486","observation_id":"42ec5816-5684-40d8-8f3b-ddce6bd3e19d","resolution":{"observed_at":"2026-08-08T18:10:53.366395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-08T18:10:53.369715Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.369715Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:b2cf9a89ddc37066734a95eb4d91c6752070df3d56d3a60ee23613b1214091d4","observation_id":"b1c35814-267b-4b9e-9abe-6ac178bfb733","resolution":{"observed_at":"2026-08-08T18:10:53.369715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-08T18:10:53.373963Z","title":"L., Liu, Y ., Shang, N., Sun, Y ., Zhu, Y ., Yang, F., and Yang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.373963Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:9c9d4bced743c4341f62782c29c6ffda6e1d5bfcc50e67453630d828cbe4fa0f","observation_id":"bb67e40f-4cf7-42ae-8179-a6522be88ea6","resolution":{"observed_at":"2026-08-08T18:10:53.373963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-08T18:10:53.380575Z","title":"Measuring math- ematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.380575Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:cbe8aa8b8ae61a5d028242b8d1cf59b4fd55fbada1b880191c9ba4322adb637e","observation_id":"e0267fe8-794e-4583-8a94-005c3ab57fbd","resolution":{"observed_at":"2026-08-08T18:10:53.380575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T18:10:53.384027Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.384027Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:68e4cd3b1deca3504a5f116c0a7b4c51b0fcd14e0f9f78bf1427ea3e17fff73a","observation_id":"ae9d5c95-2e19-4a76-95f1-22213100fe36","resolution":{"observed_at":"2026-08-08T18:10:53.384027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-08T18:10:53.386861Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.386861Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:1ef82855915d605f47c3db9d70cfd4d1669c5959763c211a09a0dcadaafa8194","observation_id":"cbbde740-5f70-4ffc-9d45-157e1e11084d","resolution":{"observed_at":"2026-08-08T18:10:53.386861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11635","last_updated":"2021-05-06T10:18:59Z","snapshot_observed_at":"2026-08-09T09:04:20.589971Z","submitted_at":"2020-12-21T19:02:41Z","title":"A Distributional Approach to Controlled Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.11635","snapshot_observed_at":"2026-08-08T18:10:53.390096Z","title":"A distri- butional approach to controlled text generation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.390096Z"},"links":{"cited_paper":"/paper/2012.11635","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:d231f5d3e0aeb44bf6fa0204a509443a307b1f6a9fa64b66477af32e108fe7d9","observation_id":"184611e2-ca00-49f0-9320-c3fe399d533d","resolution":{"observed_at":"2026-08-08T18:10:53.390096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T18:10:53.396690Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.396690Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:777045668401ab0389f096f5f963d2e213c00742c6b6771c63123bf7cf05777c","observation_id":"c620067a-5469-4982-bbf5-665206007a51","resolution":{"observed_at":"2026-08-08T18:10:53.396690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10799","last_updated":"2025-01-18T15:38:03Z","snapshot_observed_at":"2026-08-03T17:44:00.877213Z","submitted_at":"2025-01-18T15:38:03Z","title":"Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10799","snapshot_observed_at":"2026-08-08T18:10:53.399807Z","title":"Step-kto: Optimizing mathematical reasoning through stepwise bi- nary feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.399807Z"},"links":{"cited_paper":"/paper/2501.10799","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:e52a2007e8362235c268c131cead5089470a0742e99f44eb2d944d4a594e9bca","observation_id":"633c2580-ae6d-44b5-8df8-b43e7dba58a0","resolution":{"observed_at":"2026-08-08T18:10:53.399807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04350","last_updated":"2025-04-15T03:59:54Z","snapshot_observed_at":"2026-08-01T14:48:09.844175Z","submitted_at":"2024-10-06T04:03:00Z","title":"TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04350","snapshot_observed_at":"2026-08-08T18:10:53.403293Z","title":"M., Liu, X., Wen, L., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.403293Z"},"links":{"cited_paper":"/paper/2410.04350","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:13a6bb53cbc7c7556552d613c74249236eea0de3557577502805f73f0a88231a","observation_id":"fb198fad-5d20-4ba4-8b02-351a13ba207f","resolution":{"observed_at":"2026-08-08T18:10:53.403293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T18:10:53.406513Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.406513Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:2d757f3df671acfbc8463e7da5e9220239fbbecb7d850fbe638875b35d108d1d","observation_id":"01f88fa3-c77b-44a4-9d1a-f45e326b74e3","resolution":{"observed_at":"2026-08-08T18:10:53.406513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02479","last_updated":"2024-06-10T10:18:46Z","snapshot_observed_at":"2026-07-06T17:25:05.974815Z","submitted_at":"2024-02-04T13:16:29Z","title":"BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback","version":2},"cited_work":{"arxiv_id":"2402.02479","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02479","snapshot_observed_at":"2026-08-08T18:10:53.591723Z","title":"BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback","venue":"cs.LG","work_id":"aec86bf9-c270-4e0a-a3ad-d1b19f657861","year":2024},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.409932Z"},"links":{"cited_paper":"/paper/2402.02479","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:716d8f2954d545b07ded2395286d22cd5f7142bf4eaae7acd6bb6ac1a6f54cfc","observation_id":"52924448-f3bd-467e-863b-c2a89593b9da","resolution":{"observed_at":"2026-08-08T18:10:53.595190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-08T18:10:53.414173Z","title":"Y ., Yuan, W., Cho, K., He, H., Sukhbaatar, S., and Weston, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.414173Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:ba983cf8eb617d809bb7b885e22781d3bb492ee209c44bbcb73b5779c1ef8355","observation_id":"9b4352dd-93a6-40ec-bb58-8b885156257f","resolution":{"observed_at":"2026-08-08T18:10:53.414173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08517","last_updated":"2019-12-18T11:05:27Z","snapshot_observed_at":"2026-08-04T02:59:02.318368Z","submitted_at":"2019-12-18T11:05:27Z","title":"Distributional Reinforcement Learning for Energy-Based Sequential Models","version":1},"cited_work":{"arxiv_id":"1912.08517","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.08517","snapshot_observed_at":"2026-08-08T18:10:53.568502Z","title":"Distributional Reinforcement Learning for Energy-Based Sequential Models","venue":"cs.LG","work_id":"743ba0f9-13d3-43c1-a123-0279ce93825e","year":2019},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.417248Z"},"links":{"cited_paper":"/paper/1912.08517","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:de0f2d81296cdf67e88c5f1b286b3ce3cbfe766bcb4ec45270b3db2f18585468","observation_id":"3c873275-e653-42f2-a8b7-2bd1fb2da73f","resolution":{"observed_at":"2026-08-08T18:10:53.574432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-08T18:10:53.423975Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.423975Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:804ed7f27565bb147a581c43af03251eee6f995e715af36a9b71589f508a59f8","observation_id":"6ca434a0-5e97-4251-bae6-9b0c3d111987","resolution":{"observed_at":"2026-08-08T18:10:53.423975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T18:10:53.426779Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.426779Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:807d191878ba241d2fef23f9e45e8cec5589043f0f93e44541ac90422323aca9","observation_id":"99303e61-f71a-423f-bb96-2215a3635f4d","resolution":{"observed_at":"2026-08-08T18:10:53.426779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-08T18:10:53.433659Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.433659Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:d67ceef913d756e37e7cff02d632dbf7112c24da97d0cacd14f16d9a7cff3bd6","observation_id":"38788a5f-748a-40cb-8c14-7866e2068cf4","resolution":{"observed_at":"2026-08-08T18:10:53.433659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-08T18:10:53.436669Z","title":"Offline reinforcement learning for llm multi-step reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.436669Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:752de6e93b4f1b7bd111798a3117a587fb3cea6d74ecbfb4b5f20d1289260b67","observation_id":"3b599f16-a305-4fc8-9721-66e3ce66ec3c","resolution":{"observed_at":"2026-08-08T18:10:53.436669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-08T18:10:53.439730Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.439730Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:7c2b2a040e74a8e84293cde0214f02689407426f635734e40326dcb901722321","observation_id":"4169deec-8b4d-4d56-b262-25b42c7f9643","resolution":{"observed_at":"2026-08-08T18:10:53.439730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-08T18:10:53.442993Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.442993Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:30d436d000025c827ef442f1dbb3191f1119b383b0d32ea98886caa32cec1502","observation_id":"404700b7-9a2b-4d46-9a65-bf8dc02287f0","resolution":{"observed_at":"2026-08-08T18:10:53.442993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-08T18:10:53.446974Z","title":"Mario eval: Evaluate your math llm with your math llm–a mathematical dataset evaluation toolkit, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.446974Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:d2cb0caecdc6ffa85581e4f1df684767a2043554c1a2ebc878c4592b196ee642","observation_id":"2c915cf3-30ac-4f5a-a29b-5b1223555aed","resolution":{"observed_at":"2026-08-08T18:10:53.446974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-08T18:10:53.450848Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.450848Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:0b99dcf448ebf56510f1e1306bbe09cb61a933d5729d864ed5b308a3ae7da4b4","observation_id":"0247b814-5dab-4ed2-8f03-997e2df12d94","resolution":{"observed_at":"2026-08-08T18:10:53.450848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-08T18:10:53.454224Z","title":"Deepseek-coder- v2: Breaking the barrier of closed-source models in code intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.454224Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:7a5690c694c180a51fdf332b2f3ecebe3a151070a45a1c7ad748e1c270223ed7","observation_id":"9c916166-c222-4c93-a4fe-a1c463add787","resolution":{"observed_at":"2026-08-08T18:10:53.454224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:53.849579Z","title":"Treating the sequences as a whole, the original DPO loss is given by LDPO(x, y+, y−, c+, c−) =− log σ X t rt(x, y+) − X t rt(x, y−) !","venue":null,"work_id":"88d1a009-52cb-45e7-94dd-e0698ac58aca","year":2025},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.458422Z"},"links":{"citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:5403a56e63ba9d90a51ad9e5da414f4a8fbeb92bac9b02ca0acdf33399d5a8e7","observation_id":"50182318-2c61-450f-9ba8-3b7aaa1fd591","resolution":{"observed_at":"2026-08-08T18:10:53.853162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T18:10:53.430637Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.430637Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:462dd2313134ae64b823e0309bc88add77e117de23c265840bb46679b3b0937e","observation_id":"7d34b587-4f78-4d23-ab71-4222eaa0414b","resolution":{"observed_at":"2026-08-08T18:10:53.430637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-08T18:10:53.420778Z","title":"Ui-tars: Pioneer- ing automated gui interaction with native agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.420778Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:b0f84fe187b12a674b211de1f6cae73cdeceeba3e5923e2125d2b67d04ccac2e","observation_id":"fa0fa2ab-c8a0-4e6d-b5be-63ace50658b6","resolution":{"observed_at":"2026-08-08T18:10:53.420778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-08T18:10:53.355108Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.355108Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:66a4ed46c564729c177f68a9a2553818412c3950798b4f1b6bc66e2461d631c6","observation_id":"9192cd6e-6866-4b1a-8956-9477bd06f053","resolution":{"observed_at":"2026-08-08T18:10:53.355108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-08T18:10:53.393381Z","title":"Step-dpo: Step-wise preference optimiza- tion for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.393381Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:a45eab771e6e780be98a1486a0d4c406ac8328625b876f738ebdd02cbbe57549","observation_id":"4f4307c2-cea9-4983-a12e-5a00a1d79f35","resolution":{"observed_at":"2026-08-08T18:10:53.393381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-08T18:10:53.348818Z","title":"Back to basics: Revisiting reinforce style optimization for 9 Prior-Informed Preference Alignment learning from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.348818Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:1631ded90f197e80009b8e99161df57aabd594ff16d1a99483d1792cd9da7052","observation_id":"bb563930-792b-4ab2-b5c8-1eef0d77164f","resolution":{"observed_at":"2026-08-08T18:10:53.348818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:10:53.345556Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.345556Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:cac726e948f6cb163394c78bafa942d5d5790b3b4320c89fd4d9bf17da554c61","observation_id":"1d47ed88-ee14-4d31-a401-0e3114e2f2d0","resolution":{"observed_at":"2026-08-08T18:10:53.345556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T18:10:53.377526Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.377526Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:875fee2fb0cb8b9d2a1f902ba67fdb102f8606b154f5f3eb60e86fb271720d0e","observation_id":"b5eb9dc4-4f7a-4afb-96da-16520c492d9f","resolution":{"observed_at":"2026-08-08T18:10:53.377526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:59:38.249498Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2502.05773."}