{"as_of":"2026-08-04T12:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ca80ad3768fd95192f8f672c7435e582f765dd93834e398f58b1a477291f060","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:00:53.827430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T09:34:04.394588Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2403.07691"},"observation_digest":"sha256:892d52e39dcccc032b44f51dd00716218082566f9e0c90ce640d4a04d320abd2","observation_id":"73fa1a52-2f38-4c64-a58c-de79b310f68f","resolution":{"observed_at":"2026-05-16T09:34:04.707958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:1f9682c3964211bf7ab213cdd4ea4d057e08eb93db7868f97fa3ea87e8ebe3ed","observation_id":"0b09bcf4-e9eb-4ddc-840d-b79250750aaf","resolution":{"observed_at":"2026-05-16T09:16:17.483570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T06:25:00.376073Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2412.15115"},"observation_digest":"sha256:a4a060095a8078537fae5864c76cf71c7cb5dba55f72d1b248e7b569b6e84b8d","observation_id":"6fc7a908-e2fc-48ce-bc07-3bf1539d8369","resolution":{"observed_at":"2026-05-23T06:25:27.899604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2502.06387","last_updated":"2026-04-07T06:33:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-10T12:15:27Z","title":"How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-23T03:56:18.703995Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2502.06387"},"observation_digest":"sha256:9314fe620d1cbb84ba5d1fc12a7fd0ae1d0f6162a1801302886a838334f7d255","observation_id":"95f05551-4bd2-4d8b-8c57-24adc9473adc","resolution":{"observed_at":"2026-05-23T03:57:29.575352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ac6b36dda96badb2414f919a96321e9f573d45990871ae7d44f649af3939c407","observation_id":"c93a8b98-a211-439d-86d1-bf05ae4a3959","resolution":{"observed_at":"2026-05-11T05:26:05.576663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2505.19134","last_updated":"2026-04-13T23:58:15Z","snapshot_observed_at":"2026-07-06T21:30:04.828669Z","submitted_at":"2025-05-25T13:11:55Z","title":"Incentivizing High-Quality Human Annotations with Golden Questions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T13:41:26.730528Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.19134"},"observation_digest":"sha256:8088b21adea25a2cd29ba7f9912688eb7aa3e7cbea9ece52126961922419c07b","observation_id":"5fea45f8-50fa-4f09-9407-96a73b02ce3a","resolution":{"observed_at":"2026-05-19T13:42:19.352622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2510.13830","last_updated":"2026-05-09T20:37:45Z","snapshot_observed_at":"2026-08-02T04:59:01.213690Z","submitted_at":"2025-10-10T08:57:34Z","title":"Users as Annotators: LLM Preference Learning from Comparison Mode","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T08:19:58.093621Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2510.13830"},"observation_digest":"sha256:54d643d7593dbcb87428afceea663bcd8bd7c0faa0b77d2c982125f32b12082a","observation_id":"b1810d4c-e22a-4a9e-b1f4-565668a357f8","resolution":{"observed_at":"2026-05-18T08:21:07.012995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2604.11446","last_updated":"2026-04-13T13:28:12Z","snapshot_observed_at":"2026-07-06T22:59:49.614780Z","submitted_at":"2026-04-13T13:28:12Z","title":"Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:20.180349Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2604.11446"},"observation_digest":"sha256:c6f3a4937f88eb1e4cdf8e062786cdcfd88d4b822db0f83a6fab21ee057a721b","observation_id":"b3c752b3-7b51-4c17-af23-0b4694293918","resolution":{"observed_at":"2026-05-11T09:16:04.419338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:90474fcb003c5f3f70df45359949510c84edd3f693a7f4b8e50fe3d2eca8529c","observation_id":"ee674794-cfa2-4c6b-abdd-e3641071a541","resolution":{"observed_at":"2026-05-10T14:00:28.159008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:932abbe6c405f621c05ec697ade36a3385520fe27dec218487e9db5b988f8d14","observation_id":"d3ebbd09-47a7-412e-97bf-eac652a28814","resolution":{"observed_at":"2026-05-10T13:20:25.604855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:29ee118af337f06e41935d22370b6f9dba5f86d7327a2f6906f42efc7cd4a7c4","observation_id":"8bdc2aa2-39d8-4cc2-a6a1-fa90e214838c","resolution":{"observed_at":"2026-05-11T13:26:03.869033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2605.02626","last_updated":"2026-05-04T14:15:24Z","snapshot_observed_at":"2026-07-30T07:44:04.614445Z","submitted_at":"2026-05-04T14:15:24Z","title":"Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:13.659698Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2605.02626"},"observation_digest":"sha256:410643eab4cea5b53e612d957d6918d1380e85434edfa2ef30c1b1838419bc29","observation_id":"3a406e49-0558-4235-92b8-ab3799e9c7d8","resolution":{"observed_at":"2026-05-09T06:20:41.718303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2605.09119","last_updated":"2026-05-09T19:07:35Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T19:07:35Z","title":"Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:16:09.213612Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2605.09119"},"observation_digest":"sha256:4b4c884fff4d03d54bc95a95f495f9bee5c5155919d9e0a6588e4ae416a1d614","observation_id":"9dcd4027-37e4-456c-b1e5-32c00cd4bbd3","resolution":{"observed_at":"2026-05-12T03:16:18.568531Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:dd352731a0658ab46e2ecf22f8d4eacea7e6e88ca432d8d5b4c928030cf4c0bb","observation_id":"9e9cfa9b-6513-47ce-a9ae-ac8768437ab2","resolution":{"observed_at":"2026-05-13T07:37:29.945673Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2605.15012","last_updated":"2026-05-14T16:12:30Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:12:30Z","title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T03:18:26.590871Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2605.15012"},"observation_digest":"sha256:3123f07885309f2877daa323ca75311c57d3af7fef871bb6715180e4f8b0015f","observation_id":"90b60aec-fea5-48c8-a609-4e07d988c717","resolution":{"observed_at":"2026-05-15T03:19:43.017450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.05054","last_updated":"2026-06-03T16:12:30Z","snapshot_observed_at":"2026-07-06T23:45:06.925235Z","submitted_at":"2026-06-03T16:12:30Z","title":"Boosting Self-Consistency with Ranking","version":1},"reference_index":185,"source":"arxiv_source","source_observed_at":"2026-06-28T06:49:58.051659Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.05054"},"observation_digest":"sha256:a0b3745e34a43c2adc7c264b0974f86be807a2ac6613fb808498adbb5a47d5a6","observation_id":"8fe3cacf-d709-4e12-97df-291176f3fe31","resolution":{"observed_at":"2026-06-28T06:51:44.296018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.09043","last_updated":"2026-06-08T05:24:15Z","snapshot_observed_at":"2026-08-02T05:26:25.857871Z","submitted_at":"2026-06-08T05:24:15Z","title":"DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T17:26:17.072017Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.09043"},"observation_digest":"sha256:dc765c3151cd4b6a8e5d95768e0be2736298965b3c7be97d6be3c07e484e9144","observation_id":"7b24150e-32d1-49a0-aa08-65e809dabaa6","resolution":{"observed_at":"2026-06-27T17:31:06.957727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:5043a140ec118a12261f457dde44c7291a00d0a518cbf06b963981a4653c8cdf","observation_id":"bcf61e05-b703-4838-96f2-ca6ee50f3ef2","resolution":{"observed_at":"2026-07-03T01:37:30.515245Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:bac80d0f1226ed3c89f384f18a08e2012729e1cd42f432a6d232efbb7af4c6ba","observation_id":"24da175c-92c6-47ff-9ec0-a4ccd107e1a7","resolution":{"observed_at":"2026-07-03T04:47:38.282385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.13209","last_updated":"2026-06-11T11:19:03Z","snapshot_observed_at":"2026-08-01T16:03:12.508186Z","submitted_at":"2026-06-11T11:19:03Z","title":"Understanding helpfulness and harmless tension in reward models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T07:06:23.680572Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.13209"},"observation_digest":"sha256:d4a3a14b23de1fb0efda91351be75434880a16320108ba050a2a746b0eb9c924","observation_id":"84b2b752-56a8-4a70-ac76-0f528db5dc7a","resolution":{"observed_at":"2026-07-03T14:18:22.991762Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":210,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:d9a3aae929a6d57723dc5db131535b32c10fa5f87f0c40fbdbf0b37d27280c6d","observation_id":"33796558-f5e7-46a1-87c9-9ca4b3415e13","resolution":{"observed_at":"2026-07-04T07:59:40.105153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":null,"work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:c4d61dd6f781935fabc0346e0b58163b8f6f92fb7e4db9fc2b3eaf33f7ea28e1","observation_id":"90eb243c-e305-431b-99ab-b8b2084915af","resolution":{"observed_at":"2026-06-30T12:44:40.135832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-07-14T15:37:01.391649Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-02T08:00:28.789067Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T15:37:01.391649Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:e77110342b4d32c1b02cc3f137b546123afba94323bae28068ece424b79b89a2","observation_id":"e39d2557-3329-4f19-bc1b-9b02bb77a51b","resolution":{"observed_at":"2026-07-14T15:37:01.391649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-02T08:00:53.827430Z","title":"Secrets of rlhf in large language models part ii: Reward modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09796","last_updated":"2026-07-20T03:41:16Z","snapshot_observed_at":"2026-08-02T08:00:28.789067Z","submitted_at":"2026-07-09T09:20:25Z","title":"Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:00:53.827430Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2607.09796"},"observation_digest":"sha256:e4f99dfd2ed6420d38fc9ec699cbf2f3b721e9778a0e11724427f4c99df4c8b3","observation_id":"e433b4e7-168e-4078-ad68-e57a0bc95423","resolution":{"observed_at":"2026-08-02T08:00:53.827430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-01T03:14:12.745471Z","title":"arXiv:2401.06080","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-03T22:20:11.508314Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.745471Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:f7c7177b52cc2aecdccb5b33de85fd6b83239df20a6acfb0bd13686053fc24d0","observation_id":"36eec2bb-fe64-48d6-9715-b767de896496","resolution":{"observed_at":"2026-08-01T03:14:12.745471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.06080/citation-record","integrity":"/paper/2401.06080/integrity","json":"/paper/2401.06080/citation-record.json","paper":"/paper/2401.06080"},"outbound":[],"paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2401.06080."}