{"as_of":"2026-08-23T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:416ec086381f78873595eac97b4de2998db6cd62d2d51e721ed777c7f2db58ac","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:02:43.718310Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T21:25:38.650008Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-12T19:40:15.662140Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10545","last_updated":"2025-02-17T23:14:08Z","snapshot_observed_at":"2026-08-19T03:12:20.783914Z","submitted_at":"2024-11-15T19:36:15Z","title":"Efficient Alignment of Large Language Models via Data Sampling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:40:15.662140Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2411.10545"},"observation_digest":"sha256:d07a7dcd273d4240f14e93676ec81f5f81200de6d5f6bdc7ffa3b1a61a57e385","observation_id":"3ed7ad6e-b5db-4026-8e0b-6a6ffabe27d5","resolution":{"observed_at":"2026-08-12T19:40:15.662140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-11T20:10:16.120361Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06000","last_updated":"2024-12-08T17:19:48Z","snapshot_observed_at":"2026-08-16T18:51:44.812129Z","submitted_at":"2024-12-08T17:19:48Z","title":"Does RLHF Scale? Exploring the Impacts From Data, Model, and Method","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:10:16.120361Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2412.06000"},"observation_digest":"sha256:bafd17c607f9c3e0ab1b4c9e8c0bba71ea3c3449a00f3bb16d86fa3fa0c02a64","observation_id":"6113cc10-fc17-433c-ba21-e4283a48f874","resolution":{"observed_at":"2026-08-11T20:10:16.120361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-11T10:41:24.040308Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16475","last_updated":"2024-12-21T04:07:17Z","snapshot_observed_at":"2026-08-18T01:37:48.564993Z","submitted_at":"2024-12-21T04:07:17Z","title":"When Can Proxies Improve the Sample Complexity of Preference Learning?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T10:41:24.040308Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2412.16475"},"observation_digest":"sha256:21c131bcc374ead01f2b32be2f0049ffe7d1dcbcaa0b3df9703b6a6ad1b47ff9","observation_id":"7c46f08b-c16d-4d5b-b3dc-097a730d8a2d","resolution":{"observed_at":"2026-08-11T10:41:24.040308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-10T23:21:34.662433Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-18T08:51:59.333838Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.662433Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:38627cd23d28f8d38b632c70c4ebb7baa3212aefc306a34dcafbe1b67dffdf3a","observation_id":"b9ef3da2-eead-474a-8b86-200a858c4dc4","resolution":{"observed_at":"2026-08-10T23:21:34.662433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-10T21:51:08.647086Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03884","last_updated":"2025-05-30T04:56:02Z","snapshot_observed_at":"2026-08-14T02:18:54.465541Z","submitted_at":"2025-01-07T15:46:42Z","title":"AlphaPO: Reward Shape Matters for LLM Alignment","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T21:51:08.647086Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2501.03884"},"observation_digest":"sha256:df5cff06f3560afafe2475ded27c218191dc3572329a2d2fba287cae9122c05b","observation_id":"ea404f9e-bb08-4250-989e-7ef428c33648","resolution":{"observed_at":"2026-08-10T21:51:08.647086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-10T18:05:43.122286Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-22T13:40:38.082260Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T18:05:43.122286Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2501.11651"},"observation_digest":"sha256:f0d46336fbc77c7adb81a777ff51d6a720e0b8692caf59099864b828c899eddd","observation_id":"fb2d9cc5-83f4-4ffb-a3af-d78b90e26c4c","resolution":{"observed_at":"2026-08-10T18:05:43.122286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-10T16:58:02.560951Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-17T20:21:27.504758Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T16:58:02.560951Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2501.12735"},"observation_digest":"sha256:b68441abe52b3e5099e0cd839001f564f07becdf484329e0af0608bcea406654","observation_id":"dc65dccf-c32c-4e79-840d-5f81612232a5","resolution":{"observed_at":"2026-08-10T16:58:02.560951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-10T17:50:56.473929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13124","last_updated":"2025-01-21T05:36:13Z","snapshot_observed_at":"2026-08-20T05:25:14.214401Z","submitted_at":"2025-01-21T05:36:13Z","title":"Debate Helps Weak-to-Strong Generalization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T17:50:56.473929Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2501.13124"},"observation_digest":"sha256:4aafeb34e5392fcb3548dff45c2db1aa71ec6818301591d27623a9e1bd5b371d","observation_id":"aa73abb2-54c2-4e48-a89f-a33772d9189b","resolution":{"observed_at":"2026-08-10T17:50:56.473929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-09T19:56:28.755116Z","title":"Scaling laws for reward model overoptimization in direct alignment algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00203","last_updated":"2025-02-07T20:38:07Z","snapshot_observed_at":"2026-08-13T11:52:46.445681Z","submitted_at":"2025-01-31T22:39:04Z","title":"Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:56:28.755116Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.00203"},"observation_digest":"sha256:26e51d952d7095ce4a32f6a82d982926da439b57e62da88d0d37fd2b8d63b234","observation_id":"cc797453-adac-4bdb-ab5e-8508b2d32668","resolution":{"observed_at":"2026-08-09T19:56:28.755116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2502.00955","last_updated":"2026-04-24T08:45:39Z","snapshot_observed_at":"2026-08-15T02:21:16.079524Z","submitted_at":"2025-02-02T23:20:16Z","title":"Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T04:06:23.521344Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.00955"},"observation_digest":"sha256:2e0d810bcd1a7aec6e646d5b70a0b4b80714389ddb6eb3c25ff7823520411f7c","observation_id":"654159bd-80c1-483a-a5a9-817426e5da63","resolution":{"observed_at":"2026-05-23T04:07:30.581082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2502.01237","last_updated":"2026-05-08T19:36:24Z","snapshot_observed_at":"2026-08-15T11:40:36.888485Z","submitted_at":"2025-02-03T10:54:14Z","title":"The Differences Between Direct Alignment Algorithms are a Blur","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T03:50:03.720389Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.01237"},"observation_digest":"sha256:ecbe34300b53bfbe70f7312ba08eca04bc26120bab2ffc8565baca96cc4e83d3","observation_id":"f5dbe9b9-0893-4154-bab4-d4f8e1d9ca7d","resolution":{"observed_at":"2026-05-23T03:52:29.541271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-09T11:34:57.128745Z","title":"Scaling laws for reward model overoptimization in direct alignment algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02671","last_updated":"2025-02-04T19:26:28Z","snapshot_observed_at":"2026-08-12T19:27:02.778679Z","submitted_at":"2025-02-04T19:26:28Z","title":"On Teacher Hacking in Language Model Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:34:57.128745Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.02671"},"observation_digest":"sha256:2e19b24290fc6830f250406baf96387695bbf414bf95ac0aed09b4308a2de2e1","observation_id":"b8af2d07-08a3-4725-832d-7f275034c4bd","resolution":{"observed_at":"2026-08-09T11:34:57.128745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-08T19:40:42.034684Z","title":"Scaling laws for reward model overoptimization in direct alignment algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-11T15:21:29.975453Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.034684Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:3efeb95b4e92c14d65ada5112d850a442e11ebecbb249301dd64a01c7017cda7","observation_id":"5f84b809-9c0b-464b-9ae6-7e16dff56c16","resolution":{"observed_at":"2026-08-08T19:40:42.034684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T18:32:21.165463Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-21T08:01:58.640924Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.165463Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:a81da8776aef6787ec36e060bd5ed5977d6ff167a414d8f280dd204b3a917d07","observation_id":"85b9a4a5-97aa-499d-8585-18d3b2556cd4","resolution":{"observed_at":"2026-08-07T18:32:21.165463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T07:24:12.845841Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2503.11926"},"observation_digest":"sha256:01adfb79a1d7d1126f375796b3bfbc785f1cf89e85ef2186f9d850f8e5b593a0","observation_id":"2e5be1d0-c8d3-4d4d-b9bd-fb63ec9bd4c0","resolution":{"observed_at":"2026-05-21T07:24:12.951783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-16T12:02:43.718310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13828","last_updated":"2025-04-28T12:41:07Z","snapshot_observed_at":"2026-08-18T03:47:57.203659Z","submitted_at":"2025-04-18T17:55:58Z","title":"Generative AI Act II: Test Time Scaling Drives Cognition Engineering","version":3},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-08-16T12:02:43.718310Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2504.13828"},"observation_digest":"sha256:991f854c1eee8c2b72478b2779df74c853ab2652f1768b811453d3a1b972f0e5","observation_id":"12ba28b3-adb4-40ea-813f-c0a3460688a0","resolution":{"observed_at":"2026-08-16T12:02:43.718310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T11:20:11.242520Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-19T03:42:01.548140Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:11.242520Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:80c56f94f2cbfe6ca54abfeb4e52a1908d08888346234e620cea6d37e009fa6f","observation_id":"c50e7a09-cd8c-4f95-834e-d184db24cd46","resolution":{"observed_at":"2026-08-07T11:20:11.242520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T05:21:58.735489Z","title":"Sikchi, Joey Hejna, Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-17T00:40:28.013808Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.735489Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:762d5f724484ea8357b0d3d57a3865571ab61d9fd449ce55a90f84b547803aab","observation_id":"14082912-204e-42f1-be50-db845eab2700","resolution":{"observed_at":"2026-08-07T05:21:58.735489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-15T16:56:25.196345Z","title":"Plappert, M.; Mandery, C.; and Asfour, T","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19527","last_updated":"2025-08-27T02:45:09Z","snapshot_observed_at":"2026-08-17T21:43:41.912745Z","submitted_at":"2025-08-27T02:45:09Z","title":"MotionFlux: Efficient Text-Guided Motion Generation through Rectified Flow Matching and Preference Alignment","version":1},"reference_index":497,"source":"pdf_text","source_observed_at":"2026-08-15T16:56:25.196345Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2508.19527"},"observation_digest":"sha256:61a636be0bc5d9f9ae2d58e6a923321cae82b4f96830c2c813e7f9c5b98c7305","observation_id":"e92e82e7-7810-42a0-a808-f87d2fe05105","resolution":{"observed_at":"2026-08-15T16:56:25.196345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-08-15T04:57:38.385397Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:4906dca9cb2d70d85a77cd7f63e88e7a0d1e28c3f6a5f836afaf9650de6e2de9","observation_id":"3792cc63-5474-4262-842a-4b7510ffd3c7","resolution":{"observed_at":"2026-05-18T14:02:39.742787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-04T14:52:21.625861Z","title":"Rafailov, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.625861Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6f4efa2d5a98f71ce4aba22f295f6a47ef505061c7d17134155b0cf845c15ff3","observation_id":"3b0f04f9-5a26-44f5-aa62-e5839e6ae26b","resolution":{"observed_at":"2026-08-04T14:52:21.625861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2605.06977","last_updated":"2026-05-07T21:48:26Z","snapshot_observed_at":"2026-08-14T22:58:22.207248Z","submitted_at":"2026-05-07T21:48:26Z","title":"$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:13:29.292351Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2605.06977"},"observation_digest":"sha256:14251851af79981988c08a59933e77444465305134482835d4d16631fde80593","observation_id":"c9a5dd00-2d51-4200-862c-00d96d761481","resolution":{"observed_at":"2026-05-11T04:35:58.777308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-21T03:37:15.843744Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:56942b1626daad0a38883dfc180c3fd20c19d19f770948d403e7410476fe4346","observation_id":"c85fdfea-fd70-4bc8-876d-ca122f1d053c","resolution":{"observed_at":"2026-05-19T17:22:41.901099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:3888ba0d73305979b5c919e605c7ae26a0f0b2dd3253d5614b2e818b243bdc14","observation_id":"f77a5d46-b854-482b-a836-d89b4262c404","resolution":{"observed_at":"2026-05-13T04:57:17.190388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:82863d33892144d0c6745061ed56cb0115309f4df2653aef06addd9459abd437","observation_id":"052f7ede-3118-4acd-924c-a2163db2c137","resolution":{"observed_at":"2026-05-15T05:45:06.584220Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":"2406.02900","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-07-08T21:25:38.650008Z","title":"B., Finn, C., and Niekum, S","venue":"cs.LG","work_id":"f959e0ed-a9df-409e-a8db-ec3d23671531","year":2024},"citing_paper":{"arxiv_id":"2607.05904","last_updated":"2026-07-07T06:59:30Z","snapshot_observed_at":"2026-08-15T07:14:25.601844Z","submitted_at":"2026-07-07T06:59:30Z","title":"More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T21:20:07.569587Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2607.05904"},"observation_digest":"sha256:6ca53b0d7718e7a6cf2ba82a77373608fea79aae17db4d78780b8f7d42eb72ff","observation_id":"c8f2e35b-8718-4d47-a563-965679ca8cff","resolution":{"observed_at":"2026-07-08T21:25:38.651895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-02T16:22:43.863555Z","title":"Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16195","last_updated":"2026-07-22T02:34:16Z","snapshot_observed_at":"2026-08-16T12:07:24.389277Z","submitted_at":"2026-04-14T04:27:15Z","title":"Rater State Bias in RLHF Preference Data: An Audit Framework","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T16:22:43.863555Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2607.16195"},"observation_digest":"sha256:392c0bafa46afb4a9c6634440b9cdc4c4e10b16ad91bcb062dd29594ac2c4bcf","observation_id":"c101aeed-a13c-4375-bc23-474edfb88b27","resolution":{"observed_at":"2026-08-02T16:22:43.863555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.02900/citation-record","integrity":"/paper/2406.02900/integrity","json":"/paper/2406.02900/citation-record.json","paper":"/paper/2406.02900"},"outbound":[],"paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2406.02900."}