{"as_of":"2026-08-10T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:075a24851ebda9584cb16bcfb03d1cadccef696d16e378bde92623977724c03e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:56:28.769248Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T03:50:03.720389Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T03:52:29.440835Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"cited_work":{"arxiv_id":"2502.00203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-aware preference optimization: A unified mathematical framework for model alignment.arXiv preprint arXiv:2502.00203","venue":null,"work_id":"a7be4db7-7430-4f1f-b472-e4e34ef39e59","year":2025},"citing_paper":{"arxiv_id":"2502.01237","last_updated":"2026-05-08T19:36:24Z","snapshot_observed_at":"2026-08-06T16:27:29.744138Z","submitted_at":"2025-02-03T10:54:14Z","title":"The Differences Between Direct Alignment Algorithms are a Blur","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T03:50:03.720389Z"},"links":{"cited_paper":"/paper/2502.00203","citing_paper":"/paper/2502.01237"},"observation_digest":"sha256:966d110a5ee5a8de31fe931c4ac3aa70a18837c24259e117b9362132e0a858dd","observation_id":"af1d7231-a962-4122-a1fb-96b00ac11ab6","resolution":{"observed_at":"2026-05-23T03:52:29.449642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"cited_work":{"arxiv_id":"2502.00203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-aware preference optimization: A unified mathematical framework for model alignment.arXiv preprint arXiv:2502.00203","venue":null,"work_id":"a7be4db7-7430-4f1f-b472-e4e34ef39e59","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2502.00203","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:d0b13723ed02862ddee1797adf28cbc0c54408f354659418d4af9effabe94b21","observation_id":"a01f68e3-aa5b-46ee-b15d-5caafd728814","resolution":{"observed_at":"2026-05-18T13:11:24.076019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"cited_work":{"arxiv_id":"2502.00203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00203","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-aware preference optimization: A unified mathematical framework for model alignment.arXiv preprint arXiv:2502.00203","venue":null,"work_id":"a7be4db7-7430-4f1f-b472-e4e34ef39e59","year":2025},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-07T14:13:20.121484Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2502.00203","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:61018cacde0a95e413d7015655b7c1c193ed1f05942bb2a4071d0bb059141c7d","observation_id":"5af4bffb-29f1-4d3a-8af2-9b417ce00858","resolution":{"observed_at":"2026-05-18T01:40:42.424355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00203/citation-record","integrity":"/paper/2502.00203/integrity","json":"/paper/2502.00203/citation-record.json","paper":"/paper/2502.00203"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-09T19:56:28.697231Z","title":"Back to basics: Revisit- ing reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.697231Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:f953b86eb5390d1d37ef557f0c99d452d7c4e509310652a273d2a3e0de2c18e2","observation_id":"69e45135-5d22-49a7-bf09-00d5fa0e46f6","resolution":{"observed_at":"2026-08-09T19:56:28.697231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-09T19:56:28.710631Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.710631Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:d6fbf8b1f44a215517a12c069cb85a0e72b8085e5e88f566e0d5f529b5c3a9e0","observation_id":"e3627262-c55a-41e9-b908-abca547f4dd9","resolution":{"observed_at":"2026-08-09T19:56:28.710631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-09T19:56:28.713883Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.713883Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:5529c36f162111f2675e672d236bfc74a5e4cc098013eddc0ba98d88c32876b0","observation_id":"8e749a7b-8e54-4a70-b955-848fab332b7b","resolution":{"observed_at":"2026-08-09T19:56:28.713883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19316","last_updated":"2025-03-03T08:22:25Z","snapshot_observed_at":"2026-08-02T12:00:09.704648Z","submitted_at":"2024-05-29T17:39:48Z","title":"Robust Preference Optimization through Reward Model Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19316","snapshot_observed_at":"2026-08-09T19:56:28.717046Z","title":"Robust preference optimization through reward model distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.717046Z"},"links":{"cited_paper":"/paper/2405.19316","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:cb44fae19cc4efe4ae722eca742e7ed99cc02c01354b08a1281e80093f9c45ac","observation_id":"a3f408ca-681e-4cd4-8491-8de269854632","resolution":{"observed_at":"2026-08-09T19:56:28.717046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-09T19:56:28.725883Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.725883Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:7251d0cce63ecb01fa892f872b3ab63e4c7f852f50f9cfb41bde91f802694bf2","observation_id":"9ab1b5b4-5906-4666-9f96-4d2cedd5778c","resolution":{"observed_at":"2026-08-09T19:56:28.725883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-09T19:56:28.732083Z","title":"Y ., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.732083Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:af520746c878a3ab6daf065b63129292e53f05a79498387c88ab932b9c74713c","observation_id":"20a1f14d-6478-4baf-afa2-647e70f491c5","resolution":{"observed_at":"2026-08-09T19:56:28.732083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03650","last_updated":"2024-10-03T17:13:04Z","snapshot_observed_at":"2026-08-03T13:15:41.992380Z","submitted_at":"2024-09-05T16:08:19Z","title":"On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03650","snapshot_observed_at":"2026-08-09T19:56:28.735011Z","title":"On the limited generalization capability of the implicit reward model induced by direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.735011Z"},"links":{"cited_paper":"/paper/2409.03650","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:a852c027152ef1bdbcf423d9f101314ebccffa038d2e597bd4782b8a6b0b514c","observation_id":"3e3f52cc-106b-49cc-a082-07622696c53c","resolution":{"observed_at":"2026-08-09T19:56:28.735011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13709","last_updated":"2024-08-22T17:56:15Z","snapshot_observed_at":"2026-08-10T09:52:17.685683Z","submitted_at":"2024-07-18T17:08:10Z","title":"Understanding Reference Policies in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13709","snapshot_observed_at":"2026-08-09T19:56:28.738108Z","title":"Understanding reference policies in direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.738108Z"},"links":{"cited_paper":"/paper/2407.13709","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:7a226d6adcac605ba31774e4828beda608c64dd601d7a7a2324ae6c626e16242","observation_id":"1ddadaa7-79ca-4955-90c9-4269033b9fd9","resolution":{"observed_at":"2026-08-09T19:56:28.738108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-09T19:56:28.740814Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.740814Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:134129c9734c55e8541382eb37b9500ea9b9ff831d5d5e1f2b3d10ccb8f1628a","observation_id":"27b6e860-e0be-41eb-967f-f367df79c73a","resolution":{"observed_at":"2026-08-09T19:56:28.740814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T19:56:28.743682Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.743682Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:7f2cdc2a8896e39fe87782967f000705cc08e0b0c143a93fe9ae4c63e03a75f5","observation_id":"bd5fae76-ad93-4da6-9fe2-5c56c71041ef","resolution":{"observed_at":"2026-08-09T19:56:28.743682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-10T10:05:36.769699Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-09T19:56:28.746367Z","title":"H., Bhattacharya, P., Brundyn, A., Casper, J., Catanzaro, B., Clay, S., Cohen, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.746367Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:030f9bc5efca2ac2cf7835f85b70524dab5e695e4e413833507c1ebb19a52326","observation_id":"4c0fcfeb-f141-4e29-a27c-39268687e145","resolution":{"observed_at":"2026-08-09T19:56:28.746367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T19:56:28.749374Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.749374Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:b868ffb3fd9c12bb52e208ecded55ea9274de13e9c0caeefb203ee0dff7ccf5e","observation_id":"384bfe6f-d557-4d0b-9b7d-d8d4b5c0f8af","resolution":{"observed_at":"2026-08-09T19:56:28.749374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02479","last_updated":"2024-06-10T10:18:46Z","snapshot_observed_at":"2026-07-06T17:25:05.974815Z","submitted_at":"2024-02-04T13:16:29Z","title":"BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02479","snapshot_observed_at":"2026-08-09T19:56:28.752139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.752139Z"},"links":{"cited_paper":"/paper/2402.02479","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:b408c2760c3748e293620253933b690d68472dc8a3983080ffa2d5a4b9d7ed5e","observation_id":"94b9be56-243b-4c62-9fa7-7ebc6fdeee8b","resolution":{"observed_at":"2026-08-09T19:56:28.752139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-09T19:56:28.755116Z","title":"Scaling laws for reward model overoptimization in direct alignment algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.755116Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:ef9bc36b68e9fa9c3914d2420bcd595db5a089cf58a0e082c213ddaf9cd3ae4d","observation_id":"cc797453-adac-4bdb-ab5e-8508b2d32668","resolution":{"observed_at":"2026-08-09T19:56:28.755116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T19:56:28.758042Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.758042Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:09e83ab0c99deade0831e417697b53e0dbd8433978da2df59a582fc0fddb8b08","observation_id":"782e18f3-73c0-4f7e-9288-22e51973d69b","resolution":{"observed_at":"2026-08-09T19:56:28.758042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-09T19:56:28.760860Z","title":"org/abs/2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.760860Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:717c371f0cca2eee5a6fb25b549a3e0983304e50bd02ea6cca88a91ac1fd42d5","observation_id":"7e702691-ad86-4d0c-9497-413ef50c3867","resolution":{"observed_at":"2026-08-09T19:56:28.760860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15339","last_updated":"2026-05-07T20:32:48Z","snapshot_observed_at":"2026-08-06T15:22:00.046544Z","submitted_at":"2024-08-27T18:04:07Z","title":"UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15339","snapshot_observed_at":"2026-08-09T19:56:28.763679Z","title":"K., Zhu, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.763679Z"},"links":{"cited_paper":"/paper/2408.15339","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:6a462fccfb6bcf63cae5a6059a770503a7ec52fa452f094f7349e42e83d4d23e","observation_id":"12010ffa-1fd9-42e5-addc-0cff30feee9b","resolution":{"observed_at":"2026-08-09T19:56:28.763679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:56:28.929461Z","title":"Derivation of the distance functions for the multi-response scenario Squared Distance with Leave-One-Out (sqloo)","venue":null,"work_id":"da4468a8-28d5-472f-9fee-4d3e98e2d260","year":2024},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.769248Z"},"links":{"citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:9328785987833b8d2fad57e1958f40f68aadf446b677ac1fd9e4694109ce64c5","observation_id":"9207d0b3-f7ff-4bed-bf8f-158b6cd46bd3","resolution":{"observed_at":"2026-08-09T19:56:28.934595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11827","last_updated":"2024-10-03T21:37:02Z","snapshot_observed_at":"2026-08-07T01:07:23.105104Z","submitted_at":"2024-06-17T17:59:13Z","title":"WPO: Enhancing RLHF with Weighted Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11827","snapshot_observed_at":"2026-08-09T19:56:28.766564Z","title":"P., Gonzalez, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.766564Z"},"links":{"cited_paper":"/paper/2406.11827","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:07c412188826994abde5e4114de3d5bdca781b0babe96f8c5f6cb3f41f249c1c","observation_id":"a69ea086-f250-4866-94bb-414bd814c046","resolution":{"observed_at":"2026-08-09T19:56:28.766564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09279","last_updated":"2024-10-07T21:24:59Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T16:17:21Z","title":"Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09279","snapshot_observed_at":"2026-08-09T19:56:28.729035Z","title":"A., Choi, Y ., and Hajishirzi, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.729035Z"},"links":{"cited_paper":"/paper/2406.09279","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:984bdc534a47ead030da3ea28e6c531489cad68148a828db191d5d10256022bb","observation_id":"b6527333-4fa8-4f80-8b2e-aa2ad2bf0918","resolution":{"observed_at":"2026-08-09T19:56:28.729035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:56:28.940140Z","title":"Self- play fine-tuning converts weak language models to strong language models","venue":null,"work_id":"3a93993d-4778-4ad3-9252-33563a21e793","year":2023},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.707785Z"},"links":{"citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:a0b671db150c6ed1dcb9a86e51c2022fcd5a2a0ffb7d4ba4c6aa7c3a6dd3cecd","observation_id":"c759edbc-5ff6-4263-80e9-adbb94926641","resolution":{"observed_at":"2026-08-09T19:56:28.943209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-09T19:56:28.704450Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.704450Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:3fd8f344f01fcd8aa006f94f785779ea898a10cded2a5b099b1d4807f94e28e9","observation_id":"7551adda-81c8-4e25-a0e7-ed146cf186c2","resolution":{"observed_at":"2026-08-09T19:56:28.704450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T19:56:28.720194Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.720194Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:100c1711f7ed5435b4badd8a45b1eb4116bb5c732a75826e29dc98d43f7fae64","observation_id":"92d1c810-93ec-4e19-b669-115200e9cb7e","resolution":{"observed_at":"2026-08-09T19:56:28.720194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T19:56:28.701124Z","title":"Training a helpful and harmless assistant with rein- forcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.701124Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:5e69d2cef1fc35a05131f9820b7135a500af437e0a8a450fcacf0e7225c18054","observation_id":"58aef049-732a-4b19-bbe3-52df308e82d4","resolution":{"observed_at":"2026-08-09T19:56:28.701124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-09T19:56:28.723018Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.723018Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:d578f64f0de853ad2d93ce4ec0b81c5484fed3979c52bebbe75d4717680bf978","observation_id":"202baf4c-ee47-40ec-a812-86f42ce925fb","resolution":{"observed_at":"2026-08-09T19:56:28.723018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:55:51.825459Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 3 inbound Pith citation observations for arXiv:2502.00203."}