{"as_of":"2026-08-06T15:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99f34937b46f4b69bd098bbf5c1e362220e243bf94281984a02043b4384d878f","coverage":[{"denominator":226,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:58:53.430492Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:46:24.060900Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:09:59.250632Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-08-06T14:18:13.260138Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:a1b40e5c000160a47fe8be5a791be72fb41da112eab9e28ed89ac16fa4a73c03","observation_id":"cc76e99e-c79d-4848-a707-cde085ffddd0","resolution":{"observed_at":"2026-05-12T07:11:24.516462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2605.20744","last_updated":"2026-05-20T05:46:52Z","snapshot_observed_at":"2026-08-01T19:34:25.326316Z","submitted_at":"2026-05-20T05:46:52Z","title":"Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T06:56:27.532299Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2605.20744"},"observation_digest":"sha256:aaba951ddc1db2413a8d330468ce33e76ce1d25eff362a98ca85e9b859dff34c","observation_id":"74c9d888-376f-4efb-ae4d-cff041a65c38","resolution":{"observed_at":"2026-05-21T06:59:45.516029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2605.21384","last_updated":"2026-05-20T16:41:51Z","snapshot_observed_at":"2026-08-03T04:17:36.867521Z","submitted_at":"2026-05-20T16:41:51Z","title":"SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-21T03:07:18.501526Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2605.21384"},"observation_digest":"sha256:add9b0dbbe62650f33db4737f25da555cae64c3251316bf790339683245b0fdf","observation_id":"22ee4113-7cd4-4403-902d-90fad0defb4c","resolution":{"observed_at":"2026-05-21T03:09:28.068255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:f42f675a8c71bd427000b61cc583d949b3658db46e18b8465d9eb216dd9ccd26","observation_id":"eb18a35c-3c6f-4fad-8258-7d320d3709c0","resolution":{"observed_at":"2026-07-02T01:46:26.988139Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.07629","last_updated":"2026-05-30T18:47:52Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-30T18:47:52Z","title":"Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T19:03:47.751245Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.07629"},"observation_digest":"sha256:7973eb648fb0fb16c4557ec79cf947f1a6996f2e67f022f93c6d4a3917b468e4","observation_id":"5ee66b74-647c-412d-abc9-e4cd12b6eba6","resolution":{"observed_at":"2026-06-28T19:32:35.333499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.07631","last_updated":"2026-05-31T04:28:21Z","snapshot_observed_at":"2026-08-05T09:45:33.215183Z","submitted_at":"2026-05-31T04:28:21Z","title":"Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:37:51.505359Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.07631"},"observation_digest":"sha256:e69ac7519649f5b9fbc3950fdbc99b2bcba768967a7c840391b930ae20b6b1e8","observation_id":"3a289666-6857-4571-8bd5-b26cf354cb12","resolution":{"observed_at":"2026-07-01T20:56:13.904184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.07682","last_updated":"2026-06-05T00:39:44Z","snapshot_observed_at":"2026-07-06T23:47:19.773490Z","submitted_at":"2026-06-05T00:39:44Z","title":"SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T21:47:13.517559Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.07682"},"observation_digest":"sha256:17730ad2c876fb4f80babb18e93eea3fa75c523e8f561d50fa3ef387766cee1c","observation_id":"0729db69-5fcb-4995-ab95-501cfe6f26d0","resolution":{"observed_at":"2026-07-02T18:57:16.834650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.17735","last_updated":"2026-06-16T09:55:45Z","snapshot_observed_at":"2026-08-06T04:38:28.462018Z","submitted_at":"2026-06-16T09:55:45Z","title":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T00:48:56.892634Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.17735"},"observation_digest":"sha256:104ad5f9fdcee5b5ef326f206ae186ffc6bce42678fc0b034aa9371c3f0fe6f6","observation_id":"9aac31a8-6bc2-4a4a-a4b0-ac0388280c0b","resolution":{"observed_at":"2026-07-03T21:18:58.372138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.22043","last_updated":"2026-06-20T13:48:19Z","snapshot_observed_at":"2026-07-06T23:56:59.635251Z","submitted_at":"2026-06-20T13:48:19Z","title":"When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T11:43:17.464276Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.22043"},"observation_digest":"sha256:afe484ac4c60de8a574e7a5c46d2043e79d5f918a4d126e9e652a9886ab65ec6","observation_id":"d89a4452-e096-4d33-8b68-729c58dc0919","resolution":{"observed_at":"2026-07-04T08:29:41.285399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.23075","last_updated":"2026-06-22T09:23:50Z","snapshot_observed_at":"2026-08-02T06:16:18.387353Z","submitted_at":"2026-06-22T09:23:50Z","title":"Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-26T08:11:30.091859Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.23075"},"observation_digest":"sha256:d45bc188e02e695d833670654f048c4738c1ce1d8a6f90fe338b1f3d3f9cece7","observation_id":"bcbceadb-3aed-4fb8-a09d-3b46875b3568","resolution":{"observed_at":"2026-07-04T10:59:47.071970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.24597","last_updated":"2026-06-23T13:53:55Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T13:53:55Z","title":"Qwen-AgentWorld: Language World Models for General Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:31.403419Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.24597"},"observation_digest":"sha256:c24571f3e49753e593648cd35f2e67f73f2d6c73937d97d63811744d9e8a1c8e","observation_id":"0df4ba4a-50bb-4bf3-bb44-84de3a8933c0","resolution":{"observed_at":"2026-07-04T17:09:59.252242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Reward hacking in the era of large models: Mechanisms, emergent misalignment, challenges.arXiv preprint arXiv:2604.13602, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-02T02:14:15.956064Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:965767c376b075dbcc8db33ae1a646f39b2743e58034d47a5941a9baa228d3fe","observation_id":"2c18de61-e383-4132-824b-f5493ab66445","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-08-01T07:46:24.060900Z","title":"arXiv preprint arXiv:2604.13602 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21356","last_updated":"2026-07-23T14:19:28Z","snapshot_observed_at":"2026-08-06T04:37:02.729327Z","submitted_at":"2026-07-23T14:19:28Z","title":"Emergent Misalignment Recruits a Pre-existing Persona Subspace","version":1},"reference_index":224,"source":"arxiv_source","source_observed_at":"2026-08-01T07:46:24.060900Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2607.21356"},"observation_digest":"sha256:c8f36e5c5021485926f5999b83bd1f0192b09d843c5320da7cdb6cc14bf82bf2","observation_id":"83cd68cc-71d2-4648-b741-ed0ff45997e5","resolution":{"observed_at":"2026-08-01T07:46:24.060900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.13602/citation-record","integrity":"/paper/2604.13602/integrity","json":"/paper/2604.13602/citation-record.json","paper":"/paper/2604.13602"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:e72d019c31b98b2e140fef35faa97df2700b28be7ae48876ff2b223f0bf916c1","observation_id":"0e8509c1-b05a-4f42-8d6c-79298cbd4ff5","resolution":{"observed_at":"2026-05-18T19:46:50.541611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of reinforcement learning from human feedback.Transactions on Machine Learning Research","venue":null,"work_id":"88c4fec6-71fe-4f65-83f3-0a519203da8a","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:7ff4ed69271e96b1cbfa1363a3483c12ac8f56de8f785070dae4486f2f7153c5","observation_id":"c85a473a-0067-4abd-bad7-fd3cfe4c7615","resolution":{"observed_at":"2026-05-18T19:46:50.545842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.572","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning large language models with human preferences through representation engineering","venue":null,"work_id":"85eed9b5-603c-4624-ac86-9f8a40304997","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0d4026690d5f8259d8d13555b139c2478b6c6f6a36804f10d98a7364414e0cbe","observation_id":"1a7bf647-8b40-493f-a9d7-c49475831274","resolution":{"observed_at":"2026-05-10T14:00:27.553748Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":"2401.06080","doi":"10.48550/arxiv.2401.06080","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Secrets of RLHF in large language models part II: Reward modeling","venue":"arXiv (Cornell University)","work_id":"f37659bb-882a-46af-89a3-bf53a8c0969c","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:d62180cb6047042823d3ee1cfc166ac434d3ef87688b50785d30f26583d6892c","observation_id":"ee674794-cfa2-4c6b-abdd-e3641071a541","resolution":{"observed_at":"2026-05-10T14:00:28.159008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:b0351241d5500e60d2af0d93af02a8e7dfc8db7bb908da9d7869b1e43cf390f3","observation_id":"9d876178-e2d2-4d19-929b-0c3ca68121ab","resolution":{"observed_at":"2026-05-10T14:00:28.356799Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":"2309.00267","doi":"10.48550/arxiv.2309.00267","metadata_source":"pith","pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","venue":"cs.CL","work_id":"81d8781d-2933-4e89-97ee-9bbfc6d4ca0c","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:70d1a82d4dcab70a1232fe53797d00f2034c887a2f35effb4c25d0f00a935c60","observation_id":"55541d99-c499-4f67-a258-b3114877084d","resolution":{"observed_at":"2026-05-15T21:32:28.362135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.560761Z","title":"Let’s verify step by step","venue":null,"work_id":"1e1d0751-e17d-4e3e-aa61-95245c4f49c8","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3bfcfa294e6127e9cb56940d8fe3ce1432d168ec14604ce7e2e63190ac62088a","observation_id":"315a149b-e24e-4b60-a8d8-8baea651d419","resolution":{"observed_at":"2026-05-18T19:46:50.400928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:2e9631c2442b07283b634ef0e9fd4f0aa1814a586fbe1113737a00db2530e961","observation_id":"fe29475e-3944-49f6-b01d-59f3f79e23bf","resolution":{"observed_at":"2026-05-10T14:00:28.332297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a931839-7c51-4ee5-aef7-380bda43c365","year":2022},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:02db672ec181d1372073414701353ce6f4ac929c19add0860a36a420238071cb","observation_id":"abf8f6f8-49ae-4bc5-95f5-3907c587f465","resolution":{"observed_at":"2026-05-18T19:46:50.423848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:d5b74dc70b4fda38475e6ae8580386c945cd5405f6d766bff5743666f0c93e5d","observation_id":"bb988816-832d-4ee8-88c9-7dde67053251","resolution":{"observed_at":"2026-05-11T05:16:34.191262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":"86f1c7e5-cce5-4452-ad3a-2f9c1bd939ba","year":2022},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:fa9e3ed0dba81302358e587b6e7e07439876807c719cabd27cd33c7c14126bd2","observation_id":"e255ae72-6bf7-4389-a83d-e7408661beab","resolution":{"observed_at":"2026-05-18T19:46:50.520638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms.Advances in Neural Information Processing Systems, 37:126207–126242","venue":null,"work_id":"3805edd9-aa1a-49da-8cde-b96b9f28d2b9","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:1a0635de50d407c94c335aa15f4d414803f7983556d9c7e45b70fc2eadabd323","observation_id":"25d08292-515e-4491-a56c-086036cab351","resolution":{"observed_at":"2026-05-18T19:46:50.431233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specification gaming: The flip side of AI inge- nuity","venue":null,"work_id":"186137a8-9273-4db0-80ad-90a7792ce29b","year":2020},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3f9701b84c025f89e0f6460099124731b5232b559aa46a4398ed52850409a36a","observation_id":"76dedaeb-dbdd-4bdb-9db6-ca702c7c3939","resolution":{"observed_at":"2026-05-18T19:46:50.408687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goal misgeneralization in deep reinforcement learning","venue":null,"work_id":"cac86b58-b0c9-4661-af68-a2e2366d8e7f","year":2022},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:b12c5487ce5d8d5974cccc80327f7fce94535cb5887db130ad519cbf8421b33b","observation_id":"4945711b-6761-4452-8820-44d1bb2a1f39","resolution":{"observed_at":"2026-05-18T19:46:50.516681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward tampering problems and solutions in reinforcement learning: A causal influence diagram perspective.Synthese, 198(Suppl 27):6435–6467","venue":null,"work_id":"00f409b6-f3ff-4e9d-a5c0-1f5ff62f23b5","year":2021},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:bdaa96d65bab1b7775a77855b72abb103089b0bc6c3bfffc3591d43dcd0af4dd","observation_id":"b6d6f805-bb5c-4004-8bfa-1f776f472f6d","resolution":{"observed_at":"2026-05-18T19:46:50.524793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.038755Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"81ec356b-c432-49ab-a9e5-e7e5f7d699cc","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:5f5af1c0190c1061def3d439eae49dcc904adcbeea9474e24b52b43a6aa102db","observation_id":"f9b6beb9-6071-49bf-8e76-b0d56b60fbd9","resolution":{"observed_at":"2026-05-18T19:46:50.529423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:09:40.616096Z","title":"Inference-time reward hacking in large language models.arXiv preprint arXiv:2506.19248","venue":null,"work_id":"59a377b6-99b4-4400-827c-9b61c2b62d66","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:eb0b8a179c799d568e9bcc466ac18ec4affcff18e95fdddd72e03d94cea84593","observation_id":"b55aab5b-dd44-4d3e-8e1f-5767dc4f0ec1","resolution":{"observed_at":"2026-05-10T14:00:28.180253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18397","doi":"10.48550/arxiv.2511.18397","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural Emergent Misalignment from Reward Hacking in Production RL","venue":"arXiv (Cornell University)","work_id":"7ffab50f-285e-4804-b3fe-167071264d7d","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:2b6d20e5a8bf43860916195a4a7231a02b845b72778f3443cde4e5a9cf8f80e5","observation_id":"09c58fa6-834d-4aed-8a27-84070cd8227d","resolution":{"observed_at":"2026-05-10T14:00:28.164044Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward hacking in reinforcement learning.lilianweng.github.io, Nov 2024","venue":null,"work_id":"4820c64d-a113-4be7-83f1-6d7f98278ba4","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:4cbedf48ad0e1ff46bf5f62c827eafdc6fa441d31bc3e3e17fa26d1e9ee60eea","observation_id":"4d208ea7-6f5a-4571-a340-de874b52ede0","resolution":{"observed_at":"2026-05-18T19:46:50.537859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":"2112.00861","doi":"10.48550/arxiv.2112.00861","metadata_source":"pith","pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A General Language Assistant as a Laboratory for Alignment","venue":"cs.CL","work_id":"a43f9ea0-01be-47d5-b8ee-a1a9f73381c5","year":2021},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:447494f0eaddc723425cfe16ecf5524aa15d947edbafe03644fa25c24460d856","observation_id":"8015d22c-54ce-418c-9013-6eb2e1c99b7b","resolution":{"observed_at":"2026-05-11T14:23:00.363778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:13.802987+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:13.802987+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e85e42d-eaed-40aa-9021-5b3021a59f2d","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:86a879ce5538f44a7f50622514a6e6342096ba8733063efa1388b1cc8c93c6eb","observation_id":"f427ba64-a0c1-4889-8ab4-5d0b73281e14","resolution":{"observed_at":"2026-05-18T19:46:50.420379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.485272Z","title":"Reward model overoptimisation in iterated rlhf","venue":null,"work_id":"d5c73b67-c7f7-4606-9c18-3a1f81acfd2c","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:d05a2b187c10e141ff93f6c86fd308208d96bfa91e0d78dd5edc421b0483333f","observation_id":"38650516-00f4-4da6-b7aa-96ef7d1dc12b","resolution":{"observed_at":"2026-05-10T14:00:28.442149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":"2503.11926","doi":"10.48550/arxiv.2503.11926","metadata_source":"pith","pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","venue":"cs.AI","work_id":"d428a378-91ee-4965-ae16-b2fd3977bbf2","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:da1b12afc24220f4cb20dc0a7c249596d7fb5e927c633fadd5c8007d046d524f","observation_id":"927049d8-c78d-478e-a06e-760b01da2657","resolution":{"observed_at":"2026-05-21T07:24:13.179886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":"2310.03716","doi":"10.48550/arxiv.2310.03716","metadata_source":"pith","pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A long way to go: Investigating length correlations in rlhf","venue":"cs.CL","work_id":"23d0dfe6-c919-4498-8696-1e298c7834e9","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:03a279e003b5229483253f657912e80caf8286b8817afadef3a480a26d634a96","observation_id":"fb6bad19-b6c0-470f-90d7-156a88a82d12","resolution":{"observed_at":"2026-05-10T14:00:28.520666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/075280-3275","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting.Advances in Neural Information Processing Systems, 36:74952–74965","venue":"Advances in Neural Information Processing Systems 36","work_id":"20491003-4ee3-4877-8191-ba12773d0f0b","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:47afb33f2ba0c3ae17f72c8fdfc463942d9a9ae71d76d0861f1cdd09e02164b8","observation_id":"977cc880-ebea-49fc-841c-41dbf6c4d58b","resolution":{"observed_at":"2026-05-18T19:46:50.416797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:14.455455+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:14.455455+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17710","last_updated":"2025-08-24T03:35:16Z","snapshot_observed_at":"2026-07-06T17:51:02.529047Z","submitted_at":"2024-03-26T13:58:00Z","title":"Optimization-based Prompt Injection Attack to LLM-as-a-Judge","version":5},"cited_work":{"arxiv_id":"2403.17710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17710","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization-based prompt injection attack to llm-as-a-judge","venue":null,"work_id":"66710701-1037-49f4-9636-5d10324069fc","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2403.17710","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:df33ab5adca478a60357d92639e10842190bd713de94659861f1a907f09be859","observation_id":"86fc1c45-3c36-47f3-a419-05fce5e23709","resolution":{"observed_at":"2026-05-10T14:00:28.498933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:5cf8da4cdbaa6069817739522ac24c517eeaa1e06c4db58805d8fa59b04e2c29","observation_id":"27ec1131-ebdb-4855-b6bd-a4c09a599a95","resolution":{"observed_at":"2026-05-10T14:00:27.563434Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:6e8e695d10708134fbbfa1ef97b606b01a29cd89e3fca474eafd3f0b2b833c8b","observation_id":"04a6bbba-5a27-4df1-ba26-e754876ca183","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":"2401.05566","doi":"10.48550/arxiv.2401.05566","metadata_source":"pith","pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","venue":"cs.CR","work_id":"b95e7447-320c-4c85-b5d0-3708cc2cc72e","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3740c33c871066f1ec4754951e7d564fa192de98272cc95bf49eda9b51d2de9b","observation_id":"1668e36e-81f8-49e4-9a7a-1e18e5ef953c","resolution":{"observed_at":"2026-05-11T15:16:31.113595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.966538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.966538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09144","last_updated":"2023-10-13T14:35:59Z","snapshot_observed_at":"2026-08-06T14:22:24.024946Z","submitted_at":"2023-10-13T14:35:59Z","title":"Goodhart's Law in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2310.09144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09144","snapshot_observed_at":"2026-07-03T01:37:30.482804Z","title":"Karwowski et al","venue":null,"work_id":"8e0c0b7c-ce84-4571-b6a5-3fb78eaf2328","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2310.09144","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:64abb05c07aa7b63dd8981558fd3d87cd93d4cc0c0917eef0660cc043f5c7b8b","observation_id":"5dbbf9f6-bcdb-464a-930d-3adc562320ff","resolution":{"observed_at":"2026-05-10T14:00:28.494726Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"f0192069-bd4e-482a-8cc3-21271c977a00","year":2017},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:f4b53e72a13c88539c940541910ce5fc4c0f9d0b3f3321b8c2a0a31de172e658","observation_id":"0e1d2c41-f144-4bcf-80a3-5bd1448a879e","resolution":{"observed_at":"2026-05-18T19:46:50.474340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-04T06:46:45.395897Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":"2405.07863","doi":"10.48550/arxiv.2405.07863","metadata_source":"pith","pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","venue":"cs.LG","work_id":"c7ff0d97-6f12-4146-bf55-c37c42517893","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:a70d5d5d719239af5af663763033b5ed33f1ecc2ef2a5769222a2baea5af906d","observation_id":"a75bda4f-c462-414a-aa11-61c6871a12c7","resolution":{"observed_at":"2026-05-17T16:57:04.894966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:43.126704Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741","venue":null,"work_id":"d65a86ed-cf86-475e-9502-161e34d6a682","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:32c10452907bcf2b715ceb0c6fb18aa76b0f74368577e2b9194e5c0f4fd60083","observation_id":"90a99d48-e290-48c5-91be-cfbc66833dff","resolution":{"observed_at":"2026-05-18T19:46:50.482477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:8b88f5197f302670b8f05e4cc3c499e96ba49221a9684dcff914bf785dd168f0","observation_id":"a7993578-5777-4df4-9c32-c04bc96f62a0","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06627","last_updated":"2024-06-06T21:39:09Z","snapshot_observed_at":"2026-08-02T15:15:54.521833Z","submitted_at":"2024-02-09T18:59:29Z","title":"Feedback Loops With Language Models Drive In-Context Reward Hacking","version":3},"cited_work":{"arxiv_id":"2402.06627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.06627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feed- back loops with language models drive in-context reward hacking","venue":null,"work_id":"f19be27e-f4fb-4d21-8325-7c08c5fab196","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2402.06627","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:32038add4ffc623b5a914e79d46d14969d8aec0fae39fa082707b4e460ee33cb","observation_id":"207b8bc6-e046-4d22-848b-aea22f51b712","resolution":{"observed_at":"2026-05-10T14:00:28.675549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.744190Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling.Advances in Neural Information Processing Systems, 37:134387–134429","venue":null,"work_id":"ee853467-5a89-4b48-bb0a-427110c83385","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c26420c50dec3c35dd64ba0863193af7a7d9e99d1eb84b174b9ea6c7cc2c8846","observation_id":"0adf67af-19ee-4ebf-ade7-b16f8153efcf","resolution":{"observed_at":"2026-05-18T19:46:50.412595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":"2307.13702","doi":"10.48550/arxiv.2307.13702","metadata_source":"pith","pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","venue":"cs.AI","work_id":"86ca07b8-4628-4f51-8938-a82683386ae4","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:da2b761d16aa36da4381ecce296b7c668533749df6700be2bb79ffda290bf9b3","observation_id":"60de5e31-f21b-4c03-b2bc-2f4b72015464","resolution":{"observed_at":"2026-05-10T14:00:28.737021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:31.670525Z","title":"Visionary-r1: Mitigating shortcuts in visual reasoning with reinforcement learning","venue":null,"work_id":"c227c7de-f573-4665-b921-30284b6bdb9a","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0eb0b44379ce49f9ed900a2c67ef911f6bef48089ac3ba30c0895a5ccb420b42","observation_id":"76c455ab-75f2-45fd-af3c-9487386ed3d5","resolution":{"observed_at":"2026-05-10T14:00:28.706094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:17:10.144588Z","title":"LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge","venue":null,"work_id":"bd49bdd6-b2b5-4c7e-ad0d-cc07261f2b50","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:d34c305159c4141125c387576ed4c953b82d65b23cb2496dae71d96f45d12925","observation_id":"1a800c6c-9f97-4cb9-bd4c-7c1e5c164ddb","resolution":{"observed_at":"2026-05-10T14:00:28.681210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating the vulnerability of llm-as-a-judge ar- chitectures to prompt-injection attacks.International Journal of Open Information Technologies, 13(9):1–6","venue":null,"work_id":"8b7a32b8-d9c6-4980-a28e-1b615c237875","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c04e3e030654f122337798b443c093ef1148bc81628e48419c8dfa780e649017","observation_id":"1971cb80-1211-467a-9b56-fe0e600e76b8","resolution":{"observed_at":"2026-05-18T19:46:50.533928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07084","last_updated":"2026-04-19T18:13:16Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:43:14Z","title":"Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR","version":2},"cited_work":{"arxiv_id":"2603.07084","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07084","snapshot_observed_at":"2026-07-04T08:29:41.255969Z","title":"Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR","venue":"cs.LG","work_id":"04a48014-1a84-4fd9-96aa-79e954e08081","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2603.07084","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:27b301446ff481afc9c6224df98d5cbcbd2c34cedfa3e702fdbab188b2d1bdba","observation_id":"9c4a187c-4981-4197-bedc-5eea779fd39f","resolution":{"observed_at":"2026-05-10T14:00:28.794556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.473954Z","title":"Benchmarking reward hack detection in code environments via contrastive analysis","venue":null,"work_id":"07b61525-0339-4fec-964d-8fc506407daa","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3099f8fad7c810de2d0ec5f2d64a40233a3528e526ec8841478c84c7e1b7928f","observation_id":"542a1b83-6341-4fb0-9a90-2fb498e769b9","resolution":{"observed_at":"2026-05-10T14:00:28.789643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15698","last_updated":"2026-05-19T07:11:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T15:07:59Z","title":"CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2507.15698","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15698","snapshot_observed_at":"2026-06-30T11:54:38.713100Z","title":"Cold: Counterfactually-guided length debiasing for process reward models","venue":"cs.CL","work_id":"21fecb2e-5e3a-4629-8b21-dc8b5ff7012e","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2507.15698","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:fbbee2cd801b577b23364114566f427a67d49fa43fa3747fb87e25737de5b2c0","observation_id":"533848bc-7e3c-49a6-9437-236c1e7ff9b4","resolution":{"observed_at":"2026-05-20T02:04:43.676793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16727","last_updated":"2026-05-17T20:11:44Z","snapshot_observed_at":"2026-07-06T22:33:28.866887Z","submitted_at":"2025-10-19T06:36:57Z","title":"Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models","version":2},"cited_work":{"arxiv_id":"2510.16727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16727","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models","venue":"cs.CL","work_id":"9bb1c2bb-8313-4882-ae0f-e3de55036629","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2510.16727","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:cfae7c3838e07b411f1cd1fdad9ec9e4049b792f9b5cc008adb69ea08a645dd8","observation_id":"d537c5ed-1b40-4d64-b923-527cdd68e182","resolution":{"observed_at":"2026-05-20T00:04:15.044527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fanous, Jacob Goldberg, and Oluwasanmi Koyejo","venue":null,"work_id":"21b5de52-9cbf-434c-a5c3-f139307aab51","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:a18fff55aa62d2d970fb0c4c5daf837e9259dd81c1f9d11034c1da0bae612f9e","observation_id":"d7b49ea9-b866-4308-9c3a-d81ad9b418f6","resolution":{"observed_at":"2026-05-18T19:46:50.466504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":"2505.05410","doi":"10.48550/arxiv.2210.14889","metadata_source":"pith","pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning Models Don't Always Say What They Think","venue":"cs.CL","work_id":"b9bdcbf5-9ae0-464c-b1a6-de04f85a6e33","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c79571caa0a08e2900464b0fe39de8077063ac6c766991ffc9a0690d3c3e0825","observation_id":"de4e5c57-26a4-4f22-9482-9b20151a6582","resolution":{"observed_at":"2026-05-14T20:18:01.027228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring chain of thought faithfulness by unlearning reasoning steps","venue":null,"work_id":"870310df-ae4c-4af5-9fe4-709f250ba331","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:3ec7a110645534943a7ad476d21df3d2d8a22f65e4ade8967e4e52c7173bdfb5","observation_id":"ee60e2f8-1aa4-4fee-86f6-a0eb30278522","resolution":{"observed_at":"2026-05-18T19:46:50.458721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-29T23:20:20.918596Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":"2412.04984","doi":"10.48550/arxiv.2412.04984","metadata_source":"pith","pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Frontier Models are Capable of In-context Scheming","venue":"cs.AI","work_id":"1372f9da-8fac-4446-ba43-4e9e053c8b28","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c8efceed5966b4cb1363b712197c25c1ee299875ecca89a8c1830e93b448bb12","observation_id":"8f3e3e2f-7248-481a-a5b6-f29a111873ec","resolution":{"observed_at":"2026-05-16T14:22:01.750207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:14.128935+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:14.128935+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03958","last_updated":"2024-02-15T01:03:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-07T23:48:36Z","title":"Simple synthetic data reduces sycophancy in large language models","version":2},"cited_work":{"arxiv_id":"2308.03958","doi":"10.48550/arxiv.2308.03958","metadata_source":"pith","pith_arxiv_id":"2308.03958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simple synthetic data reduces sycophancy in large language models","venue":"cs.CL","work_id":"2d9bcf75-bb0c-40a0-8226-ae2940c78f23","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2308.03958","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0c59eb7b77a1313b12602a9369c4f7139787454b9a707016e483611b874dc81f","observation_id":"24121278-4a96-4719-8466-ee5670e9b7b6","resolution":{"observed_at":"2026-05-16T14:48:09.004902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.163079+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.163079+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:18:58.357399Z","title":"Reward under attack: Analyzing the robustness and hackability of process reward models","venue":null,"work_id":"98c8e480-4613-4072-b7f8-621056dc4118","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:b1d7c0d059ffdf427e334a779f008472be841916573b71ec3486f190fa9b91d8","observation_id":"475d1d02-d7ac-46dc-8a86-7e0c60d144a7","resolution":{"observed_at":"2026-05-10T14:00:28.274394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":"e50f3a3e-c39a-428a-9fd7-6787bfaae5a3","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:7ec1b7176a7e326b6427e801ffa03ea52357aaa19fbc26bacf35d3806afdef27","observation_id":"f6d0687d-22fb-443c-9341-d72077e73130","resolution":{"observed_at":"2026-05-18T19:46:50.443197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for generative reward models.OpenReview","venue":null,"work_id":"ea758a47-796c-4071-9954-84c027b88003","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:fb3661ffebabd1b294c51855ecb0b3ed5f6796558cb1cf99633470a7fb39257d","observation_id":"e149f749-99ce-4164-ba80-ea27f9ff7200","resolution":{"observed_at":"2026-05-18T19:46:50.462592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Odin: Disentangled reward mitigates hacking in rlhf","venue":null,"work_id":"afc31e92-fa99-44f1-8ca7-9e1d05ff019c","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:bd7d0706edfc75d01d52074487263dc58f13a8aea97264be54bc5877070a5bbb","observation_id":"e6b5e2cf-a409-426a-b282-7acec83ac3cc","resolution":{"observed_at":"2026-05-18T19:46:50.470407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":"f172b44b-f80c-485b-8e9d-3cce9c176ca3","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:736b717136d618b93ffcb27ee68e574aa228d34c27f2256f954ee69be6a8b080","observation_id":"a25aec91-843c-4e43-81bd-b9ad081fc315","resolution":{"observed_at":"2026-05-18T19:46:50.478159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Super(ficial)-alignment: Strong models may deceive weak models in weak-to-strong generalization","venue":null,"work_id":"40d4a537-8bd9-43eb-a469-15645a213418","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:6644c052bc6c68e12fba54c808772ca551693030e4b79bf54e1711d34b8a2c53","observation_id":"1f1f290c-3e3e-4ffc-829b-f25df71f92cf","resolution":{"observed_at":"2026-05-18T19:46:50.288612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00168","last_updated":"2024-02-02T03:41:50Z","snapshot_observed_at":"2026-07-06T16:41:27.099792Z","submitted_at":"2023-10-31T21:52:41Z","title":"The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2311.00168","doi":"10.48550/arxiv.2311.00168","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2311.00168 , archiveprefix =","venue":"arXiv (Cornell University)","work_id":"c8842f79-72a6-4bd5-b060-22e797b4a71e","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2311.00168","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:02e13ad604ff07ed6d70b840848373239421127ba66dffa3c3582bccb71bff28","observation_id":"92b21f53-dc94-49df-ad26-ea6491b33297","resolution":{"observed_at":"2026-05-10T14:00:28.451656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1150","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking the role of proxy rewards in language model alignment","venue":null,"work_id":"13708ef7-1825-4f0d-9bf6-73f19ba0320c","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:80650a27ec37e546f4e7fd1c436e9b3638ee15e7828a8c66b58ece3978837afb","observation_id":"17a625dd-79fd-4951-815c-f34206217dda","resolution":{"observed_at":"2026-05-10T14:00:27.556726Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward model ensem- bles help mitigate overoptimization","venue":null,"work_id":"06690a07-1249-47db-9431-141134b89b59","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:7e3633779e5f76e9c156b1c2ca4781d9cf03afcf927eed0ed8f26d64b49beb68","observation_id":"a77f6b45-634d-43cd-8a39-ed9dc4e6d59f","resolution":{"observed_at":"2026-05-18T19:46:50.339436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16635","last_updated":"2024-10-22T06:19:20Z","snapshot_observed_at":"2026-07-06T17:22:11.359057Z","submitted_at":"2024-01-30T00:17:37Z","title":"Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble","version":3},"cited_work":{"arxiv_id":"2401.16635","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.16635","snapshot_observed_at":"2026-07-03T01:37:30.376818Z","title":"Improving reinforcement learning from human feedback with efficient reward model ensemble","venue":null,"work_id":"2858f8af-f855-4efa-93f7-c10e4e7f9be0","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2401.16635","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:9b3f16898457e77a08c0e0e365d2aac9cd330e4347682cf2f895ebaa3b37f63c","observation_id":"226a20e1-7275-4e7c-817f-99a9d306ca2c","resolution":{"observed_at":"2026-05-10T14:00:28.337394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15360","last_updated":"2024-10-16T14:56:15Z","snapshot_observed_at":"2026-07-06T19:20:42.231272Z","submitted_at":"2024-09-18T02:35:41Z","title":"Reward-Robust RLHF in LLMs","version":3},"cited_work":{"arxiv_id":"2409.15360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15360","snapshot_observed_at":"2026-07-03T01:37:30.559409Z","title":"arXiv preprint arXiv:2409.15360 , year=","venue":null,"work_id":"aa98ce6f-abcb-4d44-b4f9-54e1616ea812","year":2018},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2409.15360","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:eec6f061c0032fffe425fda899990cb0b16c8c293a403c906b1c7ec8dc35fb28","observation_id":"b7b578d7-c0c7-49b4-ba62-867ceef01ac0","resolution":{"observed_at":"2026-05-10T14:00:28.126800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-01T23:32:03.638122Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":"1906.01820","doi":"10.48550/arxiv.1906.01820","metadata_source":"pith","pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","venue":"cs.AI","work_id":"871c0bb7-e08b-4d8b-be76-610707c748dd","year":2019},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:51a77c50e679da06d7f0d9b75a011292b12a13f55c060a85ef8e77fac52e8528","observation_id":"b5854664-fbe7-4fdd-a335-7558ff24b38f","resolution":{"observed_at":"2026-05-15T12:21:53.231465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00596","last_updated":"2025-03-01T19:35:01Z","snapshot_observed_at":"2026-07-06T20:44:59.449574Z","submitted_at":"2025-03-01T19:35:01Z","title":"BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2503.00596","doi":"10.48550/arxiv.2503.00596","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.00596","venue":"ArXiv.org","work_id":"a8cc8deb-759b-4609-bc09-0caf59b61438","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2503.00596","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:379de4bce6c93a87b3cb3d9ff4b5ea7b854bfaf80e0de95057820cd8ee3b086a","observation_id":"e67130de-71fe-4662-8b84-77b85a526725","resolution":{"observed_at":"2026-05-10T14:00:28.747730Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-02T15:33:17.783178Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":"1805.00899","doi":"10.48550/arxiv.1805.00899","metadata_source":"pith","pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AI safety via debate","venue":"stat.ML","work_id":"13c1ec37-af93-438a-bdf0-f2eafaee5635","year":2018},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:a29ca1216be56192d33c6ba4ff53785c46b949c9c0dcb6444fa0dbb1c0cda387","observation_id":"c30ea0df-3437-4df8-97ee-5a0885e60211","resolution":{"observed_at":"2026-05-13T21:22:01.373606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:04b9c5ed02e5c210374e05a0307ddfab5660c06a2df5aa0e5888a6731902577f","observation_id":"346dd22f-f42d-4ff7-83ba-9109cb697879","resolution":{"observed_at":"2026-05-10T14:00:28.208095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00787","last_updated":"2023-07-03T07:05:59Z","snapshot_observed_at":"2026-07-06T15:49:31.084659Z","submitted_at":"2023-07-03T07:05:59Z","title":"Evaluating Shutdown Avoidance of Language Models in Textual Scenarios","version":1},"cited_work":{"arxiv_id":"2307.00787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00787","snapshot_observed_at":"2026-07-03T01:37:30.222381Z","title":"Evaluating shutdown avoidance of language models in textual scenarios","venue":null,"work_id":"c1f2f763-d21c-45b8-8958-3b49e17159f7","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2307.00787","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:1c8f75a1fcf8f216af6788ece60567b7f2a9ffe264a7142dc5737f862c4de437","observation_id":"63c8c736-810b-407d-8b61-b4c2990c2001","resolution":{"observed_at":"2026-05-10T14:00:28.256202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.05619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:49:52.401426Z","title":"F., Akter, S., and Sharma, A","venue":null,"work_id":"6167c94d-0a93-4c59-b66c-274555c08868","year":2022},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:e9395793c8098c9738e140e36efb714873c50af63d70761da56a4bf11dc03151","observation_id":"0d7c9344-2761-496b-8117-6ce5797f7486","resolution":{"observed_at":"2026-05-10T14:00:28.227989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:29:41.267810Z","title":"Adversarial reward auditing for active detection and mitigation of reward hacking","venue":null,"work_id":"f91ccc2e-d9d8-4617-b93d-80e73925da79","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:7ed78656a98b2b6a78b85be47f9779132fac62fcef81a3b3901eef8f0ed5b7d0","observation_id":"fdbb1e0c-5313-4001-9d76-3df90c8d4542","resolution":{"observed_at":"2026-05-10T14:00:28.342346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21350","last_updated":"2026-05-16T02:45:10Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:45Z","title":"Factored Causal Representation Learning for Robust Reward Modeling in RLHF","version":2},"cited_work":{"arxiv_id":"2601.21350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.21350","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Factored causal representation learning for robust reward modeling in rlhf","venue":null,"work_id":"d14a3544-b06c-42f9-9e66-e8d080205151","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2601.21350","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:8e30af937c5557dd34964b6ae7a8ff708473d8020700455d5a64b208633922c6","observation_id":"5870e59e-db5a-4c20-949a-62c541897838","resolution":{"observed_at":"2026-05-20T00:03:03.363793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19358","last_updated":"2025-06-02T16:30:23Z","snapshot_observed_at":"2026-08-04T06:11:49.462081Z","submitted_at":"2025-01-31T18:10:53Z","title":"The Energy Loss Phenomenon in RLHF: A New Perspective on Mitigating Reward Hacking","version":3},"cited_work":{"arxiv_id":"2501.19358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19358","snapshot_observed_at":"2026-07-03T01:37:30.283976Z","title":"The energy loss phenomenon in rlhf: A new perspective on mitigating reward hacking","venue":null,"work_id":"93ca0048-320c-4479-8e3d-6e3ba147027d","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2501.19358","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:47f58a105d819af53d45ded28f46c4c2c2adc12920366bb4ead38e52165badd5","observation_id":"5f0da82a-13cc-46ad-954c-c5e2a52085f0","resolution":{"observed_at":"2026-05-10T14:00:28.361674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-07-06T21:48:59.271767Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:76c19a1aa77ac199274baec953b65a0a0284b6646a48fb883107b12bb310b167","observation_id":"d02bf6ef-1025-4236-a04c-8720533ff381","resolution":{"observed_at":"2026-05-10T14:00:28.296337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08093","doi":"10.48550/arxiv.2512.08093","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training llms for honesty via confessions","venue":"arXiv (Cornell University)","work_id":"cadaf446-26bb-4515-b89e-c55987d91740","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:30f3fc390bd5b13a605508945d7bab5db2a78e53bd9ed889da8d068274303215","observation_id":"138940b7-ca8f-4f8e-8328-40bc169c3791","resolution":{"observed_at":"2026-05-10T14:00:28.416737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.420443Z","title":"Monitoring emergent reward hacking during generation via internal activations","venue":null,"work_id":"131a186f-0b16-402d-8f5f-017ebde4a597","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:08aff89a813d8ce050b4ee1b5673899b8907f8406a2a040f9fb3c1b07b5438df","observation_id":"8a26d00b-9e30-475f-bdae-b122d4c5b94a","resolution":{"observed_at":"2026-05-10T14:00:28.107795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seal: Systematic error analysis for value alignment","venue":null,"work_id":"f8b2c99a-88b8-485e-9189-10e8d53e03dc","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:5a71e014f4dccc399f97a2ec52652a216394ae1dd9fa39d4e231187c72444ba3","observation_id":"7db90d6d-622f-4677-8169-82934935eb1f","resolution":{"observed_at":"2026-05-18T19:46:50.272287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":"2309.08600","doi":"10.1145/1390156.1390191","metadata_source":"pith","pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","venue":"cs.LG","work_id":"51960d72-c69f-4db8-8efd-e90e8b4d9524","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:a2e063585c116a5487237ce478b8b71eac81381b5dba6e077bf34ee2a67a7856","observation_id":"86bf31fa-5c84-42e4-9aa2-42f18786c02b","resolution":{"observed_at":"2026-05-10T14:00:28.311087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:19.66582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:19.66582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-07-06T20:52:27.848221Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":"2503.10965","doi":"10.48550/arxiv.2503.10965","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10965 , year =","venue":"ArXiv.org","work_id":"a479b1c8-1808-4da7-b836-0a4d85dcba6b","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:42c2e161404d287aa4ed724f20bab4239dee8fb59750ed0d5120669c8529b9d5","observation_id":"ecabf288-40ff-4f20-8eee-4284d200fcb7","resolution":{"observed_at":"2026-05-10T14:00:28.385565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.216386+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.216386+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22755","doi":"10.48550/arxiv.2602.22755","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auditbench: Evaluating alignment auditing techniques on models with hidden behaviors","venue":"Open MIND","work_id":"c080644a-84d5-4504-b6f2-e540dd58f590","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:2d489ef8b793e70955f1eff7f0481725d8c5609a8824a30321bff86a240e7802","observation_id":"fbb9aa9d-718d-4a07-b5e8-5ad5b7689888","resolution":{"observed_at":"2026-05-10T14:00:28.301390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09883","last_updated":"2017-11-28T17:40:36Z","snapshot_observed_at":"2026-07-31T19:22:34.165724Z","submitted_at":"2017-11-27T18:57:13Z","title":"AI Safety Gridworlds","version":2},"cited_work":{"arxiv_id":"1711.09883","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.09883","snapshot_observed_at":"2026-07-04T17:29:59.631746Z","title":"AI Safety Gridworlds","venue":"cs.LG","work_id":"fb942fdb-357d-4552-9f90-40d861ef6569","year":2017},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1711.09883","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0a04ece818f3fe687def26b9984d0cb1cfa552154c9cdfee0449dab50f3f57a7","observation_id":"e8d730ba-0210-4ae2-b09b-91d7a8d19a24","resolution":{"observed_at":"2026-05-10T14:00:28.265874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to summarize with human feedback.Advances in neural information processing systems, 33:3008–3021","venue":null,"work_id":"81c0a5a4-95c0-499b-9cca-dab308352483","year":2020},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:deaeafd103708be03a574e26bcb554a4711acb3d18d3db4fd8113172743c941e","observation_id":"b5bfe784-d5fe-45b7-a2ec-cc3ed45ddae7","resolution":{"observed_at":"2026-05-18T19:46:50.447077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":"1612.00410","doi":"10.1093/cercor/6.3.498","metadata_source":"pith","pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Variational Information Bottleneck","venue":"cs.LG","work_id":"52c66038-d680-46bf-be0c-f2d29c4daf08","year":2016},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0be5a5c184a82ba99f9a2ef3fbf241b14204e935b0ed0208da1e116175bc9dce","observation_id":"874efdf9-2757-4bec-ba78-ca0d61e8b91e","resolution":{"observed_at":"2026-05-18T06:23:00.530339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14617","doi":"10.48550/arxiv.2505.14617","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Linear Control of Test Awareness Reveals Differential Compliance in Reasoning Models , May 2025","venue":"arXiv (Cornell University)","work_id":"93a7cb6d-dad5-4a87-be0e-0b8103691e71","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:86feb5cd9dcfc143f4023c96fcee39f77b3d5cb440afbdbb4a5fc3ce973c796c","observation_id":"8f2df830-f183-4bf7-b94a-89a35a0632e1","resolution":{"observed_at":"2026-05-10T14:00:28.539831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19416","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.420655Z","title":"IR 3: Contrastive inverse reinforcement learning for interpretable detection and mitigation of reward hacking","venue":null,"work_id":"d4edf69b-2d83-4cc9-b996-a67d699e16f0","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:40d9cb51bf9a654ba04c95042ceac50a6f6d49e8826794d70434322ab0afb60e","observation_id":"59c61fc1-305c-4ba8-9156-880f50c5a1fe","resolution":{"observed_at":"2026-05-10T14:00:28.592057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpretable preferences via multi- objective reward modeling and mixture-of-experts","venue":null,"work_id":"859d1b13-cb18-4eba-92b5-56e50a6cc008","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:8e42edb7299ebe227586d94f2461184fbe42fcd643ee2c33e849670b46511ccd","observation_id":"050c6532-2489-4650-938d-71c83c608764","resolution":{"observed_at":"2026-05-18T19:46:50.450854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking diverse human preference learning through principal component analysis","venue":null,"work_id":"36a96178-bc85-47dd-8252-1dde7b33e692","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:60df4e0d8ffb5b7f7dc4f0fd7fdcee5232b0bcd4335a6facdad3f799fbe4defc","observation_id":"a9ea338e-d7fb-4f4c-9482-8238d4d4ca1e","resolution":{"observed_at":"2026-05-18T19:46:50.335636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Mari Ostendorf, and Hannaneh Hajishirzi","venue":null,"work_id":"4e64080f-71a1-4499-a99d-3ae176f34655","year":2023},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:2399de0df764d981e911c17d20854866bc7c35d7ad20e5e555678dc18a6ac64b","observation_id":"0d63e0d2-beb9-4f10-934a-582a2546c48b","resolution":{"observed_at":"2026-05-18T19:46:50.264039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RRM: Robust reward model training mitigates reward hacking","venue":null,"work_id":"bfed5264-0b44-42c6-a2d2-1242a8460a67","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c729feba1e2660a265141f23f937e4acc34f655fdbc8209e22b5db4ba1413375","observation_id":"0fe8ae02-8c2c-45b3-97ad-3030b78e8ae2","resolution":{"observed_at":"2026-05-18T19:46:50.281119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving reward models with synthetic critiques","venue":null,"work_id":"9bfe807d-bdd2-4578-8ee7-e261dc8c7d2d","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:1052523861da26ff33a400d6c405eecc8e25a920b089a216d23ac349d7b76473","observation_id":"afc74614-fdff-4c57-b91f-3135f8b91ed2","resolution":{"observed_at":"2026-05-18T19:46:50.276990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RM-r1: Reward modeling as reasoning","venue":null,"work_id":"d84e9048-2f50-4406-9522-99320046a519","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:24d1ca4d3806e82a2a37a557330bef8781c926d2261db68151b495b2d07f2a35","observation_id":"4cd80591-d8ed-4dcd-a3e4-e56db9c9f7e1","resolution":{"observed_at":"2026-05-18T19:46:50.434874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3457","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rule Based Rewards for Language Model Safety , url =","venue":null,"work_id":"4e223112-90db-4a7d-9aa5-5bd1c1dedea8","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:bf231dbb6a3eef8f1af57c52e3e74122206a2fbdf93a03007f300934d7b878e5","observation_id":"1f13836f-1619-45d7-81d5-6fd9988d3bb7","resolution":{"observed_at":"2026-05-10T14:00:27.569396Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T08:52:33.61389+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T08:52:33.61389+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06af86a0-0cd3-413d-9776-dfc89654d73f","year":2026},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:8cb2108b00f8d7087fc6684ed9b4068eaf77759b84e44743a82edd099dd74b4e","observation_id":"001ff1bb-89bb-4b94-b959-69f40597458f","resolution":{"observed_at":"2026-05-18T19:46:50.438767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Checklists are better than reward models for aligning language models","venue":null,"work_id":"7a1e8ec1-51e6-44c4-a48d-078710a22426","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:2e1a3f420f8d6e6de5c3b49fd7874ff303eb0aee8f242cdef4ee5a1f87b5aaeb","observation_id":"d15af2d2-5d0e-4eb5-bef8-24151939542e","resolution":{"observed_at":"2026-05-18T19:46:50.454591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer.Advances in Neural Information Processing Systems, 37:138663–138697","venue":null,"work_id":"701cd2e9-3ca9-4113-b392-2ee960df7d96","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:95b5ba06aa314854c4e3f7b7cb9b365107687de131567c41d5234269fb79a7d5","observation_id":"624e4f9f-6223-4245-b8a3-de2e368fcc97","resolution":{"observed_at":"2026-05-18T19:46:50.486218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nguyen, Daniel Sonntag, and Khoa D Doan","venue":null,"work_id":"db1ad5c8-0dd1-4a33-89d5-eab9c659551c","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0461c1847fe7d11fe5317f0d298a7a78aa846da9afd379ffd456ed7b2ec5a8c9","observation_id":"05da6e66-e7ac-462c-8a0c-d99f16d75eb7","resolution":{"observed_at":"2026-05-18T19:46:50.353565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08495","last_updated":"2024-04-16T17:36:39Z","snapshot_observed_at":"2026-07-06T17:59:21.208430Z","submitted_at":"2024-04-12T14:25:49Z","title":"Dataset Reset Policy Optimization for RLHF","version":3},"cited_work":{"arxiv_id":"2404.08495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08495","snapshot_observed_at":"2026-07-03T01:37:30.365669Z","title":"arXiv preprint arXiv:2404.08495 , year=","venue":null,"work_id":"ea35dcd5-fc8c-49fd-aaaf-38a5795845f8","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2404.08495","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:d380ca7e26515a572e15696768407476d37568a07b8ceef95318c737eb135a70","observation_id":"7207f407-d68d-49bb-8f94-1b724ac82cba","resolution":{"observed_at":"2026-05-10T14:00:28.778548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating reward over-optimization in RLHF via behavior-supported regularization","venue":null,"work_id":"59c70957-be61-420c-a661-e86ab86cfb78","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:2364acf495a14d35237a55f660c251f020167db3fbc141b51a48fe2a9188c5a5","observation_id":"9d4955e8-4393-4c62-9ade-ee049d886ebb","resolution":{"observed_at":"2026-05-18T19:46:50.397199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06810","last_updated":"2025-03-10T00:13:19Z","snapshot_observed_at":"2026-07-06T20:49:32.001630Z","submitted_at":"2025-03-10T00:13:19Z","title":"Mitigating Preference Hacking in Policy Optimization with Pessimism","version":1},"cited_work":{"arxiv_id":"2503.06810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06810","snapshot_observed_at":"2026-07-03T01:37:30.401380Z","title":"Mitigating preference hacking in policy optimization with pessimism","venue":null,"work_id":"6bf7f9e3-4121-4a83-98d3-d1ab42a6b86a","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2503.06810","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:6c01ec78836802fdb69c0a9c8c0ab750885f04b2a9079ef184679952569dfa65","observation_id":"69ef8545-8747-4541-8b62-3bd3b33517fc","resolution":{"observed_at":"2026-05-10T14:00:28.731714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward shaping to mitigate reward hacking in RLHF","venue":null,"work_id":"6388785b-ee26-40ff-ba16-cd7d803ea51d","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:fd25286825ee5027006a10057f31a40ee320f9fd083c8ee057528437f129dd05","observation_id":"783f11aa-53d2-48e6-981e-27500780aa49","resolution":{"observed_at":"2026-05-18T19:46:50.427333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning for large language models via group preference reward shaping","venue":null,"work_id":"cd955b97-5767-40ec-b284-0ab8fdf96158","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:606b9e9d5d87e2cf6e60cc5665a4415f87baab5f6f780aa40bccc0e7a1cbc05d","observation_id":"3d7a93aa-be25-4131-aa69-da61a19bfa54","resolution":{"observed_at":"2026-05-18T19:46:50.346560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating reward overop- timization via lightweight uncertainty estimation","venue":null,"work_id":"12fc2ec9-0cf5-4dfa-bc43-2955c84f3bef","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c488eb84201458df3cd5ec4fe7de1ba52c3335ed15246284d26412ab61d0c84a","observation_id":"5b1f4aa5-a450-4893-8c34-d596bae85fdc","resolution":{"observed_at":"2026-05-18T19:46:50.364433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regularized best-of-n sampling with minimum bayes risk objective for language model alignment","venue":null,"work_id":"87d752d2-9f5c-4c66-a22f-91bd6d5a7ce5","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:47b800a31514fdcccb4c448cb0cfe2caf5135ac60fb6ecf1f0d347e8682f2e7c","observation_id":"fbb40540-a0b5-4d23-9887-d39a431f0983","resolution":{"observed_at":"2026-05-18T19:46:50.378752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for RLHF under KL-constraint","venue":null,"work_id":"34c3db61-5402-43da-bc9d-85c58ddec3f1","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:84dce001b0418df12474713cab9522d68b474cadfde31a8090cad1a28e86f4c3","observation_id":"69b2b57e-6551-455c-84e7-e89e4f0d568e","resolution":{"observed_at":"2026-05-18T19:46:50.284925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":3,"verified_exact":46,"verified_fuzzy":40},"total_outbound_references":226},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 226 outbound references and 13 inbound Pith citation observations for arXiv:2604.13602."}