{"as_of":"2026-08-07T10:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2caaae6f931506ce30b492315ba0af7fb5c0734233f1a7fa1d44042764c74ae4","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:07:37.727362Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.11119/citation-record","integrity":"/paper/2604.11119/integrity","json":"/paper/2604.11119/citation-record.json","paper":"/paper/2604.11119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"cited_work":{"arxiv_id":"2304.01373","doi":"10.48550/arxiv.2304.01373","metadata_source":"pith","pith_arxiv_id":"2304.01373","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","venue":"cs.CL","work_id":"745b4799-6ac4-4abe-924f-78bf0a08ffa1","year":2023},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2304.01373","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:53a44245289ee62f1424937120497faa36be326f0615f4ad1a05545ce158395d","observation_id":"9fe813c5-2311-4ee6-b64b-4304dbba9dbb","resolution":{"observed_at":"2026-05-15T17:45:18.440424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ultrafeedback\\_binarized dataset card","venue":null,"work_id":"34c5386d-b537-4664-bc70-fbf459a9be11","year":2026},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:51f3a07638d8be7d1327d183226822cbe861c1976f7cd64d01b0bd9f3c0dcba0","observation_id":"a71e353f-fce8-49a7-82f9-98e65f4df5fb","resolution":{"observed_at":"2026-05-17T16:54:59.129727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":"ffc63a7c-7b5c-4074-beb1-e025b00b36a4","year":2023},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:aa29ab8a3cca606f8b65ba34e3f4cdaabb4a758fe4a43031e48203cc2f259cdc","observation_id":"6b8df648-ba88-4c28-ade9-287fbe59950f","resolution":{"observed_at":"2026-05-17T16:54:59.123616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:a61e64c1bf943ea472ea5f2a30acb9723703a56cf3d52c1ce03cbb4a9b2b4366","observation_id":"e774069b-5869-47aa-b09f-0851d665515b","resolution":{"observed_at":"2026-05-11T09:16:03.592025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:5e4ed726974bd5b39c5a9fbb0353d38f27b0c1bd4681a5336834b67a26e08860","observation_id":"6eaf6fdd-984d-48b1-9cca-df5fa6d6a2e7","resolution":{"observed_at":"2026-05-11T09:16:03.575220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mirror-descent and nonlinear projected subgradient methods for convex optimization","venue":null,"work_id":"0f5b257d-1339-43bd-a58c-bf24b7c750d2","year":2003},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:6a01d499c3844c1145774f649153eeb149e1cff305aec9939e7b16b90b6355c5","observation_id":"24d229a0-a0d3-4d10-9b52-4edad85d2f5c","resolution":{"observed_at":"2026-05-17T16:54:59.113349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":"2402.01306","doi":"10.48550/arxiv.2402.01306","metadata_source":"pith","pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","venue":"cs.LG","work_id":"28f4db09-e48a-458a-967b-755399c7d663","year":2024},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:6c81606b1a1c434216afaf61723cb43bde7ad11e852dc406a5d79de217c65fa4","observation_id":"13a09cf1-48c2-45de-a702-b4035b7b9b97","resolution":{"observed_at":"2026-05-12T12:17:53.598200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":"2403.07691","doi":"10.48550/arxiv.2403.07691","metadata_source":"pith","pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":"cs.CL","work_id":"93ad9e7b-6db2-4249-a0fa-8a96ef124d53","year":2024},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:d3983abfe8686ddc75d4bcbe70a7c85e3a27405df41b615bbcb43ed1bb156e7e","observation_id":"b0f7a24a-88aa-4950-8c18-3c6c9de38163","resolution":{"observed_at":"2026-05-16T09:34:04.958044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a25f061b-1ce4-4391-95e4-15d9be91dde1","year":1997},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:2a925ac2f9a736bc93837b4adf78ee5e07f84eca189fbd092d65da169b8fe1cf","observation_id":"2b5b1c53-1c7b-4fbf-8ab0-42dd4309dfcf","resolution":{"observed_at":"2026-05-17T16:54:59.116709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":"2405.14734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-07-08T20:05:34.173711Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":"cs.CL","work_id":"09ac9a7a-d953-4f17-acda-ac268871a79c","year":2024},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:4e1d3aee6424e4d4226a0d325dc59db04655566c0e7610402a55e8b239afa366","observation_id":"cb1bff44-c5c2-4ff6-9103-d2dacdc9e0a6","resolution":{"observed_at":"2026-05-11T09:16:03.613104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Problem Complexity and Method Efficiency in Optimization","venue":null,"work_id":"61188545-82af-4d71-b366-9d4b21b90b20","year":1983},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:99580446df12086ae91c72b44e8b6a571037283b0b026a78a91f975e7a9ca6f5","observation_id":"e5e266bb-eecc-4ba8-ac98-e3223b31d4ea","resolution":{"observed_at":"2026-05-17T16:54:59.132827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"09648ccb-c355-446b-ab48-08aad5233314","year":2022},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:cabca94a7e9d632ad87b4379fe36266d84fcc47fc0a968becd9f1a7a53aab905","observation_id":"e92a85a6-eee3-4791-a216-4083fd9ff0c8","resolution":{"observed_at":"2026-05-17T16:54:59.120202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19770","last_updated":"2026-05-12T01:02:19Z","snapshot_observed_at":"2026-07-06T21:30:28.303379Z","submitted_at":"2025-05-26T09:54:02Z","title":"Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO","version":5},"cited_work":{"arxiv_id":"2505.19770","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19770","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO","venue":"cs.LG","work_id":"4dbc3373-c7ef-4f0a-a8c5-68ccd2ca92c8","year":2025},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"cited_paper":"/paper/2505.19770","citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:e9910bf73d8a6e6f2445159aa830e1cf6b5760a628ecaaae9383695804660531","observation_id":"101ab7f2-b80d-4379-a155-f6ba02affb5d","resolution":{"observed_at":"2026-05-11T09:16:03.619193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DDO-RM LLM preference benchmark","venue":null,"work_id":"1c716695-7347-4f16-99e2-93795fc85c54","year":2026},"citing_paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T16:07:37.727362Z"},"links":{"citing_paper":"/paper/2604.11119"},"observation_digest":"sha256:b833dcd1a64b98f2fd7f67629c73b03f8e79c98f12e5f170108695fa03f9bc11","observation_id":"4bd2963f-eea1-4449-a814-bc3c150e2952","resolution":{"observed_at":"2026-05-17T16:54:59.126662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11119","last_updated":"2026-04-29T23:43:10Z","latest_version":2,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-02T12:14:21.521891Z","submitted_at":"2026-04-13T07:33:06Z","title":"DDO-RM: Distribution-Level Policy Improvement after Reward Learning"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":7,"verified_fuzzy":6},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2604.11119."}