{"as_of":"2026-07-22T01:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d3b8f6f42c426fc8d975e34c7ad4aff36cb285dcfc82ddb341cc6b8c67aca33","coverage":[{"denominator":298,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T14:43:29.496457Z","state":"measured"},{"denominator":150,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":150,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T13:32:31.523845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T11:57:03.262704Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-16T14:22:01.616448Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2412.04984"},"observation_digest":"sha256:db90a3a4bfbd9a12b4c091cce91a43d3af091cae89a5a2f8a6a2ddd99aec89d3","observation_id":"4fb0d664-6f8e-4828-b17d-c8e4117718cf","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:337dd62cb3d92796c3fb089074212792c0e125f7ada8996a75319849e33608ef","observation_id":"a5a05f9c-4ace-44cb-a4a4-b9b6b38c26a3","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2502.16810","last_updated":"2026-05-01T23:52:08Z","snapshot_observed_at":"2026-07-06T20:41:23.980642Z","submitted_at":"2025-02-24T03:36:57Z","title":"AI Realtor: Towards Grounded Persuasive Language Generation for Automated Copywriting","version":6},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T02:55:50.650423Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2502.16810"},"observation_digest":"sha256:d1309d9328766cf01c25c1b6f484025b274ec4bc2c2f2c4de06c1848aa953a55","observation_id":"e2a01161-91f0-487b-a661-a31dc246608b","resolution":{"observed_at":"2026-05-23T02:57:26.362906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T07:24:12.845841Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2503.11926"},"observation_digest":"sha256:f6433ec01201cdab02f0e58600e2d2f3bf6ec0355a6155dd2fcd8f71a96cdb5e","observation_id":"7959c5d5-1e1f-4619-8c16-28e31cc59b9b","resolution":{"observed_at":"2026-05-21T07:24:13.021176Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:2314d67a111afb54de63c57a4b4d91a03b30aa808011219b3aa8e128899efbf7","observation_id":"e2d588e2-fb9b-4a59-a291-399763e5552d","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2510.12826","last_updated":"2026-04-25T22:54:37Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-11T04:42:29Z","title":"Scheming Ability in LLM-to-LLM Strategic Interactions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T07:50:30.597108Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2510.12826"},"observation_digest":"sha256:73d7f88dad37fd8c528766227a322e08b5852f2a527072f30640b597deed67b5","observation_id":"d2d6bf6f-e464-481f-a3b1-947f54e0d5c6","resolution":{"observed_at":"2026-05-18T07:51:03.880478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2601.10467","last_updated":"2026-05-05T15:17:14Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T14:51:50Z","title":"User Detection and Response Patterns of Sycophantic Behavior in Conversational AI","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T14:03:49.595868Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2601.10467"},"observation_digest":"sha256:d45072bf0521e9ac426f27263a4a2daf1e72e923ee0a96e91be8ca53b5075dec","observation_id":"c8b301e5-4b4b-48bd-9565-55fb4453a628","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-13T14:23:49.346727Z","title":"Sycophancy to subterfuge: Investigating reward-tampering in large language models.arXiv preprint arXiv:2406.10162,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.01475","last_updated":"2026-06-08T13:23:37Z","snapshot_observed_at":"2026-07-13T14:23:49.176171Z","submitted_at":"2026-04-01T23:31:38Z","title":"Interpretable Electrophysiological Features of Resting-State EEG Capture Cortical Network Dynamics in Parkinsons Disease","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T14:23:49.346727Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.01475"},"observation_digest":"sha256:9a2a7f36dafdcb16ea36c864a1eb263f5662bf9a70841e910c17de087e143409","observation_id":"850290f5-1f27-4c80-ba82-57fe7263e17f","resolution":{"observed_at":"2026-07-13T14:23:49.346727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.02585","last_updated":"2026-04-15T18:00:16Z","snapshot_observed_at":"2026-07-06T22:51:57.889822Z","submitted_at":"2026-04-02T23:42:20Z","title":"Mitigating LLM biases toward spurious social contexts using direct preference optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T20:33:04.433907Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.02585"},"observation_digest":"sha256:818dc5a96de9d11205a6a347c7e7c60359401289a63c50b2c4082027634818af","observation_id":"a6453c93-e038-4e57-a0ee-1a5e1cdffb0c","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.02686","last_updated":"2026-04-03T03:30:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T03:30:34Z","title":"Beyond Semantic Manipulation: Token-Space Attacks on Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:29:31.354743Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.02686"},"observation_digest":"sha256:5cf8578f8a0205e5646876334456fda22454eab9fba0a6db516f4bedb56d906f","observation_id":"503dde2b-ad1c-4039-80a4-32d0c4bf66d3","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.13107","last_updated":"2026-04-10T22:39:51Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-04-10T22:39:51Z","title":"Can Coding Agents Be General Agents?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:32:59.990900Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.13107"},"observation_digest":"sha256:662986eb5b38477fc1641f1946f03e538968dfa8eb462c07e43b3618acb7bc49","observation_id":"cccddd86-e0d9-4867-8fc6-e895e98a8613","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.17573","last_updated":"2026-05-06T18:24:52Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:28:32Z","title":"Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T06:02:07.838745Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.17573"},"observation_digest":"sha256:9eeb22e47dd236517acbeef4e68c7b57a46edbd18547755c0db2101cf3933a45","observation_id":"d1174c00-9257-4c9a-b3d4-42fbe2475d1b","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:48:44.687520Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.17596"},"observation_digest":"sha256:599fa1f7dc8633f97b7886021d8bd3b4f9bf403576af3ae59f26aa6089072781","observation_id":"0c55d3be-af72-40f4-968a-f8bad6eac925","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.21564","last_updated":"2026-04-30T16:26:35Z","snapshot_observed_at":"2026-07-06T23:08:10.140279Z","submitted_at":"2026-04-23T11:34:06Z","title":"Measuring Opinion Bias and Sycophancy via LLM-based Persuasion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T21:48:37.940162Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.21564"},"observation_digest":"sha256:8b917b446bf5f189cd51a58abcad78248c59d5e09e13e47da4c34c08ae0d6dc6","observation_id":"b28d615c-c04b-4e52-a329-068aa41f8631","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-06-23T22:57:13Z","snapshot_observed_at":"2026-07-06T23:09:43.659053Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Trainig-Time Reward Hacking in Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T06:38:32.413172Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:e96acfa04524dfddac4ff07c8b3751345a5e584d2cee320e8828c0fe6aeb483b","observation_id":"c4b3d4fd-a4ff-47e1-9651-be7702087f06","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-06-23T22:57:13Z","snapshot_observed_at":"2026-07-06T23:09:43.659053Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Trainig-Time Reward Hacking in Code Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T09:56:48.019404Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:b68f68b0a75352e6acc91f04c9a4b713e0efcc9a32b85af27c0a5ec154de1fe0","observation_id":"becc456a-2e16-4f32-a635-599da5155290","resolution":{"observed_at":"2026-07-01T10:05:40.171174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:d9c54e9257372dc596548792271564cc01787660411f0036083d3c6e4e24eae0","observation_id":"b4af3104-1a7f-4deb-9d2f-1669321c1666","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.06327","last_updated":"2026-05-07T14:23:31Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:23:31Z","title":"Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:02.697982Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.06327"},"observation_digest":"sha256:55beccfef0b174b25a905d7a435d0d06a6b78ccfb603039a49f31ce42179ceb3","observation_id":"ad3f85e8-1cb4-4efe-ab5c-ef8105445446","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.08671","last_updated":"2026-05-09T04:19:03Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:19:03Z","title":"Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:24:44.369468Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.08671"},"observation_digest":"sha256:245bec860ebcf5f1b92d5b60fcfcc6d3d4a6a5bf4bd15f4e9878825ada31e553","observation_id":"40a635cc-cd21-44ed-be2e-be92d47be9e5","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.12673","last_updated":"2026-05-12T19:22:45Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T19:22:45Z","title":"Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:50.043920Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.12673"},"observation_digest":"sha256:e3ca6200edbc924a8cc08a87c6a522ff080db88ddafaf2ac4d367e67db51e70c","observation_id":"dcf2e410-a702-4925-9ad1-6e2cc7f80457","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.13334","last_updated":"2026-05-13T10:51:56Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T10:51:56Z","title":"LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-14T20:20:04.306202Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.13334"},"observation_digest":"sha256:66293b46e966f43bf679efdde369d8903c1683b1310edfd355281ce2cfd50904","observation_id":"2fd81e13-c1a7-4001-b813-c3dc5f9eedf5","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.17958","last_updated":"2026-05-18T07:12:44Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:12:44Z","title":"Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T13:13:51.081597Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.17958"},"observation_digest":"sha256:497cfe0d61eed425c1bca23d692b3778e364858b4b913f4f28f2d8f501cd38b0","observation_id":"9be1ab62-55b2-4938-9447-a40d42bd83ce","resolution":{"observed_at":"2026-05-20T13:18:18.496423Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.20744","last_updated":"2026-05-20T05:46:52Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:46:52Z","title":"Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T06:56:27.532299Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.20744"},"observation_digest":"sha256:865def893537a145db995d1ad58dee8220ea1b1969dcde54c6af3106386a06ab","observation_id":"5e2c20d4-88f5-4113-9cec-c6e4d41aed68","resolution":{"observed_at":"2026-05-21T06:59:45.584507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.21384","last_updated":"2026-05-20T16:41:51Z","snapshot_observed_at":"2026-07-06T23:31:51.443407Z","submitted_at":"2026-05-20T16:41:51Z","title":"SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T03:07:18.501526Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.21384"},"observation_digest":"sha256:a5173a09b8fb814c01a26f3811e71289f14cc76b9098b67f969052e54aef2c84","observation_id":"163fa1bc-2ac2-40b9-86f8-85da06afb0f4","resolution":{"observed_at":"2026-05-21T03:09:28.096652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.25062","last_updated":"2026-05-24T13:13:16Z","snapshot_observed_at":"2026-07-06T23:35:01.860096Z","submitted_at":"2026-05-24T13:13:16Z","title":"Cultivating Machine Intelligence: The OMEGA Shift from Top-Down Optimization to Autopoietic Cognitive Ecologies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T23:49:06.077148Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.25062"},"observation_digest":"sha256:9b5c2f30bc4c29d7b75c8bf6d3b1cf44b895b1a27170f2aed0050fce0fe3fb8c","observation_id":"43c941bf-8398-46df-95ab-a3bb1140c49f","resolution":{"observed_at":"2026-06-30T00:04:06.708859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.27914","last_updated":"2026-06-09T02:24:01Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T03:41:11Z","title":"Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T12:54:36.818698Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.27914"},"observation_digest":"sha256:d3b135cb5897bc884f1ee4147e2748298272079dfe3f3b7907c35f9e0bfd3224","observation_id":"8e1b49bd-7dde-412f-a288-9dd24e45a4cc","resolution":{"observed_at":"2026-06-29T13:03:26.784254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2605.30451","last_updated":"2026-05-28T18:20:32Z","snapshot_observed_at":"2026-07-06T23:39:43.967889Z","submitted_at":"2026-05-28T18:20:32Z","title":"VeriGate: Verifier-Gated Step-Level Supervision for GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:47:45.666708Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2605.30451"},"observation_digest":"sha256:b1918b91cf09361a195585925ed67fbb96ed6a178f539e83109fc56ba065afa1","observation_id":"f5c5f782-ca2d-4334-83a5-bbdf8fcaa1fe","resolution":{"observed_at":"2026-06-29T08:53:16.023789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.03453","last_updated":"2026-06-02T10:32:28Z","snapshot_observed_at":"2026-07-06T23:43:40.769504Z","submitted_at":"2026-06-02T10:32:28Z","title":"FORGE: Multi-Agent Graduated Exploitation and Detection Engineering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T09:45:06.217817Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.03453"},"observation_digest":"sha256:c89c5ece833cd45e0053619e9492379968c2cf225b65f74cbd9b2f973722a232","observation_id":"9241f516-fe1e-4869-b5f7-959bdb85e8c7","resolution":{"observed_at":"2026-07-02T03:46:32.324436Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:6b49b2dd7be1b892dda34181283075b51e9c2fedfe31afb96cc24317d6c2d55c","observation_id":"fc16fbca-74f8-41dc-90dd-e3b490d9c523","resolution":{"observed_at":"2026-07-02T01:46:26.998730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.05647","last_updated":"2026-06-04T03:22:17Z","snapshot_observed_at":"2026-07-06T23:45:37.713710Z","submitted_at":"2026-06-04T03:22:17Z","title":"Coding with \"Enemy\": Can Human Developers Detect AI Agent Sabotage?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T01:48:56.367899Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.05647"},"observation_digest":"sha256:19f746d271084f835a9e183dab6ab9a750e4b4f86236056c4cf599153caa6bf6","observation_id":"fb42a312-2899-4dcb-b526-a34d427c02b4","resolution":{"observed_at":"2026-07-02T12:46:57.256904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.06099","last_updated":"2026-06-04T12:38:43Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:38:43Z","title":"CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T01:41:26.750771Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.06099"},"observation_digest":"sha256:3e13d3e0203b06963838c3bad3012ab9204bc89ddb684f8cbf01d2c2e5145e7e","observation_id":"11ccc3bd-39ea-47f6-866b-26bb6a4572af","resolution":{"observed_at":"2026-07-02T12:56:57.391611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.07612","last_updated":"2026-05-29T16:38:53Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T16:38:53Z","title":"Position: Anthropomorphic Misalignment Research Needs Stronger Evidence","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-06-28T20:13:53.972585Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.07612"},"observation_digest":"sha256:15c8650b199dffd9de95a9b70fd906eb2df3d1d4ea14d67f1fc362d6549e9d99","observation_id":"394db164-97a6-452b-af4f-66a30eff9a4e","resolution":{"observed_at":"2026-06-28T20:22:37.288358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.08243","last_updated":"2026-06-06T16:01:52Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T16:01:52Z","title":"Building Comparative Motivation Profiles with Instrumental Interventions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T19:45:25.449282Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.08243"},"observation_digest":"sha256:3dfaa55361601f7e505c42db62c2c7b6f8d0c1fb426c022ed3228e9a86e68fc1","observation_id":"021bc0e7-47b4-4465-adbf-366d854ed7eb","resolution":{"observed_at":"2026-07-02T21:27:24.578512Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.08500","last_updated":"2026-06-07T07:57:22Z","snapshot_observed_at":"2026-07-06T23:47:57.376596Z","submitted_at":"2026-06-07T07:57:22Z","title":"Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.453580Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.08500"},"observation_digest":"sha256:79a492aeed990d4c255487edccfd00b26075eb76b310ce65537d3e5b4c039e51","observation_id":"c3cb19e1-bb26-4255-9b75-c2ec21ae5fe9","resolution":{"observed_at":"2026-07-02T23:17:29.846239Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.08682","last_updated":"2026-06-07T15:34:59Z","snapshot_observed_at":"2026-07-06T23:48:07.065806Z","submitted_at":"2026-06-07T15:34:59Z","title":"Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:21.388956Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.08682"},"observation_digest":"sha256:0dc6dba8854a7df61b3ac44afbc9b59c6f11d3b91c5b9e74268c72e6e874ce49","observation_id":"afbb7d4b-b34e-4d38-bcbb-c960a5214419","resolution":{"observed_at":"2026-07-02T22:57:26.132085Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.09078","last_updated":"2026-06-08T06:22:33Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:22:33Z","title":"The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T17:07:06.227106Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.09078"},"observation_digest":"sha256:45a3d3c81c0ad4f1208fa9b37325e007f8ab8316b31f35e08be44c0f8de0ef01","observation_id":"13334f28-f0b2-45fb-8562-6b4f55bf5f4c","resolution":{"observed_at":"2026-07-03T00:37:30.088793Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:8d6467d623d09809a2651c09069841024934c7639249b4e8f8a01ab7e2d1b395","observation_id":"abec1965-37cc-47c3-9e30-c79f7d008d73","resolution":{"observed_at":"2026-07-03T01:37:30.246728Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:f03d4e92d15eb9901e8a0eec00b3a1a9b94282aa6a87a9e6d1249f35b48478f1","observation_id":"b048d25a-165b-4535-94dd-fb1c50cdf804","resolution":{"observed_at":"2026-06-27T16:31:02.711701Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.10456","last_updated":"2026-06-09T06:04:30Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T06:04:30Z","title":"The Distributed Detectability Band Against Marginal-Preserving Attacks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T12:58:22.056355Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.10456"},"observation_digest":"sha256:93b5a09598fabc9725c83b9a1faa3d01398021c690f451232034b49bfa93963e","observation_id":"c2c97127-db66-4e72-a608-f67915f0aac8","resolution":{"observed_at":"2026-07-03T05:57:41.857798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.11456","last_updated":"2026-06-09T21:16:31Z","snapshot_observed_at":"2026-07-06T23:50:30.023802Z","submitted_at":"2026-06-09T21:16:31Z","title":"AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:04:40.640910Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.11456"},"observation_digest":"sha256:bae5db5c922bdde162fe00e788af74152aa12dd5dec7517471430f067094895a","observation_id":"695a078a-1ada-47bd-a064-7bb2cf29d4cd","resolution":{"observed_at":"2026-07-03T05:47:41.516909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.25973","last_updated":"2026-06-24T15:45:38Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T15:45:38Z","title":"Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T19:02:45.109478Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.25973"},"observation_digest":"sha256:e8c9609b913eb929feb6f1694cddffc0f5a72ab12cf18ab5d390cc1d4f94592c","observation_id":"1f6040cb-2e5d-4f5f-a0f6-0ef4f06ebe63","resolution":{"observed_at":"2026-07-04T21:10:09.261675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.30666","last_updated":"2026-06-18T10:25:09Z","snapshot_observed_at":"2026-07-07T00:04:29.879877Z","submitted_at":"2026-06-18T10:25:09Z","title":"Reframing AGI Confrontation with Off Earth Autonomy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T07:18:55.451342Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.30666"},"observation_digest":"sha256:9217d09cecc75da3fa5124deddbb9483e4244824966df5b379622f565c2f3710","observation_id":"c87b7cf3-90a7-4f11-a3e1-a65931e5cb4f","resolution":{"observed_at":"2026-07-01T08:35:34.308556Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.31591","last_updated":"2026-06-30T12:42:23Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:42:23Z","title":"Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T06:20:11.322710Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.31591"},"observation_digest":"sha256:2f067ad0a695ed298edf46d0a9dac16b32b9d9f48899a816988aa306bccb4500","observation_id":"039872d3-ea39-4fc4-8aae-81fc21567d27","resolution":{"observed_at":"2026-07-01T09:45:39.620492Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2607.00038","last_updated":"2026-06-28T18:30:46Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-28T18:30:46Z","title":"Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T20:40:11.059493Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.00038"},"observation_digest":"sha256:0cadaf86cf23c9fc7739401dd53bf26897cf63f0746434f6edfa87851ed0d5bb","observation_id":"213daf82-afcc-4978-a8ab-bfddf950c0e9","resolution":{"observed_at":"2026-07-02T20:47:22.229284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2607.01071","last_updated":"2026-07-02T15:40:30Z","snapshot_observed_at":"2026-07-07T00:06:39.908636Z","submitted_at":"2026-07-01T15:30:33Z","title":"MemSyco-Bench: Benchmarking Sycophancy in Agent Memory","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-02T06:29:32.975530Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.01071"},"observation_digest":"sha256:5e89b4a77b74c3e479d60dc80be830434fc7c4bc62b6cf44a540d26550456226","observation_id":"306e0df1-c2ef-4643-8799-d1f0f98ce1ac","resolution":{"observed_at":"2026-07-02T06:36:43.279118Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2607.01071","last_updated":"2026-07-02T15:40:30Z","snapshot_observed_at":"2026-07-07T00:06:39.908636Z","submitted_at":"2026-07-01T15:30:33Z","title":"MemSyco-Bench: Benchmarking Sycophancy in Agent Memory","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-03T18:50:02.455542Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.01071"},"observation_digest":"sha256:8a234eedfa8e3d52378766e46f22adc2517676eab79b7022284b02cc1db4b243","observation_id":"51465a93-53b0-4846-af79-904c1d71c737","resolution":{"observed_at":"2026-07-03T18:58:50.747148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-12T01:34:45.323277Z","title":"arXiv preprint arXiv:2406.10162 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03561","last_updated":"2026-07-03T18:49:20Z","snapshot_observed_at":"2026-07-12T01:34:31.531243Z","submitted_at":"2026-07-03T18:49:20Z","title":"How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-12T01:34:45.323277Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.03561"},"observation_digest":"sha256:45e8f3b017b9c9eed337f3213fd3557975863f60116d8d7d2129846ab5a6f888","observation_id":"2cebb91a-2087-4052-a83f-eebe9b816bef","resolution":{"observed_at":"2026-07-12T01:34:45.323277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2607.08173","last_updated":"2026-07-09T07:19:05Z","snapshot_observed_at":"2026-07-12T23:18:20.945919Z","submitted_at":"2026-07-09T07:19:05Z","title":"Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T11:54:32.051780Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.08173"},"observation_digest":"sha256:9166cb9b5dd7adabad11c2c3da92096c96745c3b13a0d1df4bf9e44cbbec14f4","observation_id":"4cfe71e8-1748-473d-8a94-d98327c9602c","resolution":{"observed_at":"2026-07-10T11:57:03.264446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-13T04:01:29.587725Z","title":"Preprint at arXiv:2406.10162 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09306","last_updated":"2026-07-19T19:56:24Z","snapshot_observed_at":"2026-07-22T01:20:45.945124Z","submitted_at":"2026-07-10T11:39:40Z","title":"A small language model detects behavioural faithfulness gaps that frontier judges and human raters miss","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-13T04:01:29.587725Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.09306"},"observation_digest":"sha256:87544ce34e052a5c9f8d48280b68c83bdc0dc6bca756b246b0254d573afc3b3b","observation_id":"9aa4ef7f-60e8-4794-8caa-439a9bb2d657","resolution":{"observed_at":"2026-07-13T04:01:29.587725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-14T13:32:31.523845Z","title":"Sycophancy to subterfuge: Investigating reward-tampering in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10202","last_updated":"2026-07-11T08:26:48Z","snapshot_observed_at":"2026-07-16T23:18:14.626311Z","submitted_at":"2026-07-11T08:26:48Z","title":"Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T13:32:31.523845Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2607.10202"},"observation_digest":"sha256:34a1b927277380a6ea820d07709740d22b9e500efb6c9f113a7752c579fde684","observation_id":"66ee4a79-8638-4e32-9a33-b90c0d16b2e9","resolution":{"observed_at":"2026-07-14T13:32:31.523845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10162/citation-record","integrity":"/paper/2406.10162/integrity","json":"/paper/2406.10162/citation-record.json","paper":"/paper/2406.10162"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking fast and slow with deep learning and tree search","venue":null,"work_id":"d14c5666-8857-4dc7-a4b6-1a35befe2781","year":2017},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:7d5e57fd540f56ec36070f349093755dc0f3338113f1c586f2a417120b2d95bb","observation_id":"8980323e-06f7-4c02-8870-1521160a9b90","resolution":{"observed_at":"2026-05-17T14:44:46.899406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding strategic deception and deceptive alignment, 9 2023","venue":null,"work_id":"1af913e1-79c1-4c81-89a4-6f863ee0a42f","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:4f017c30a261010b58e20cd82e52aa5c1d3359d7591d67771b91a3e3ed2b0448","observation_id":"2e9f8a1c-04b1-482c-8616-64badf5023b0","resolution":{"observed_at":"2026-05-17T14:44:46.924808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general language assistant as a laboratory for alignment","venue":null,"work_id":"51b13307-1831-4a7b-bea8-559d663289df","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:fbab87c761c1e2076ce7aaac597d07f9d1214a707f292a8dcf9ee61f4c49fc25","observation_id":"43e57f36-0d1e-4050-b4fe-5d0e1840076f","resolution":{"observed_at":"2026-05-17T14:43:30.327950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-11T02:47:49.311954Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:5e2052571d355d9072ec5f455656768d7a5c96516cc59ab94045785034c8f737","observation_id":"2627f3db-a064-4d79-991c-bda621d97569","resolution":{"observed_at":"2026-05-17T14:43:30.051332Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:21.899952+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:21.899952+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taken out of context: On measuring situational awareness in llms","venue":null,"work_id":"e1b48371-99f7-489c-97b5-1ad0a7257cc6","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:71a0cf701a2c6b1110f3ad1f0272549ae0d9aa1295b51853ce0fea8cd935c1e8","observation_id":"fff303b3-92dd-421d-8a26-dfda33445add","resolution":{"observed_at":"2026-05-17T14:44:46.910997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How useful is quantilization for mitigating specification-gaming? In Safe Machine Learning (SafeML) Workshop at ICLR 2019","venue":null,"work_id":"2890dbc7-f14d-4ba5-9fc8-39cf7bab17ea","year":2019},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:653c07333873fe6b31d571c03898a4c2be88ebe1876c0fe60bc8cf6a6e066c54","observation_id":"5154eb35-37f0-4c7f-903e-772b14bd91c6","resolution":{"observed_at":"2026-05-17T14:44:46.935435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10149","last_updated":"2024-05-06T06:47:30Z","snapshot_observed_at":"2026-07-06T14:53:45.768994Z","submitted_at":"2023-02-20T18:30:54Z","title":"Poisoning Web-Scale Training Datasets is Practical","version":2},"cited_work":{"arxiv_id":"2302.10149","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.10149","snapshot_observed_at":"2026-07-11T02:37:46.276610Z","title":"Poisoning web-scale training datasets is practical","venue":"cs.CR","work_id":"d7527e23-4e8f-4208-948e-180fbe9a0569","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2302.10149","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:9cd49653924508558e478064ab7a7a4b8e69c585279a694fcc8a921f8f5d536c","observation_id":"a5811194-250f-4d18-9c26-241ecd99179a","resolution":{"observed_at":"2026-05-17T14:43:30.056914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai in software engineering at google: Progress and the path ahead, June 2024","venue":null,"work_id":"d7c3e25c-2a5b-492f-a7c0-1bcd47448e66","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:82fbb50966a8f337dfefa04169250d60e216652b6c4c6096e10e3d2339649a31","observation_id":"15608572-ea6e-45f9-a237-fbd78b1d951d","resolution":{"observed_at":"2026-05-17T14:44:46.931995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Faulty reward functions in the wild, 12 2016","venue":null,"work_id":"2930488f-cc17-42e2-92d3-3cd2426735d8","year":2016},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:46bc2c74ed423ce586a53ac4d17447ae2c2c3392fe13229081bd8fa13a393c27","observation_id":"7a0a3c17-543f-4944-9f4a-44f4d7aab9da","resolution":{"observed_at":"2026-05-17T14:44:46.938764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Without specific countermeasures, the easiest path to transformative AI likely leads to AI takeover","venue":null,"work_id":"d57647de-5da8-4642-bd92-a356307b3e87","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:6b99ceb88f7e6d30119225924c1566d45e22b7b0bd40872e89e1d8e0af3597a4","observation_id":"a4f56780-5e0e-47d6-b1c4-5191d3394511","resolution":{"observed_at":"2026-05-17T14:44:46.945729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward tampering problems and solutions in reinforcement learning: A causal influence diagram perspective","venue":null,"work_id":"a4fc118b-686d-4078-b461-b06bf0218a03","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a0767799954f4882fd16f4ec8b37bdac3cffe35ca764f28f803698c0a80f37ac","observation_id":"0567688c-87fe-488a-8489-596d3ae72864","resolution":{"observed_at":"2026-05-17T14:43:30.581241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wichmann","venue":null,"work_id":"edfc8d85-7554-488a-8658-59f37bb01bb5","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:bd1cc9f1cfa072236de93d62ef6806f8c22887dc8e7fcad47f569443832b0b70","observation_id":"c6c6de70-1728-436f-bd12-71d56ea03155","resolution":{"observed_at":"2026-05-17T14:43:30.544002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":"1412.6572","doi":"10.48550/arxiv.1412.6572","metadata_source":"pith","pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-07-10T19:57:34.026407Z","title":"Explaining and Harnessing Adversarial Examples","venue":"stat.ML","work_id":"2cedf8f6-7539-4c49-8136-f42a20487146","year":2014},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:0914e0623c2ee1b45d2ad6d4db2b6b2e0088c80069630fc0f9e5e707f2247a2a","observation_id":"4fe91c92-6657-4f99-b33a-8119d1834fa9","resolution":{"observed_at":"2026-05-17T14:43:30.062305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-07-06T07:58:02.684338Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":"1906.01820","doi":"10.48550/arxiv.1906.01820","metadata_source":"pith","pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","venue":"cs.AI","work_id":"871c0bb7-e08b-4d8b-be76-610707c748dd","year":2019},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:f51f929ff05a43446aab3ebecb552894e2b5b8fcec577c232a4aa5d2edb9b9ca","observation_id":"586be625-0b5d-4e3b-8f51-0c5ef947fe5f","resolution":{"observed_at":"2026-05-17T14:43:30.066799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85938495-04b8-45fc-abbd-701229df3341","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:3a341005c7526f154fffe495196c816e3018cdc0a3c8a416f87d87cc69e0400a","observation_id":"e9e8c1bd-aa4b-44c2-aea7-3152d8cd212c","resolution":{"observed_at":"2026-05-17T14:43:30.530948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instrumental deception and manipulation in llms - a case study","venue":null,"work_id":"657dc094-e1ae-4eea-9f9b-5add44d6456c","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:721db28d41b90d48e84c1d00bca44c34d9aaa498c6891c275bb9b18f2b9320fc","observation_id":"c1c93810-b3e6-48fc-bd4f-fd61c207904c","resolution":{"observed_at":"2026-05-17T14:43:30.503629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"User tampering in reinforcement learning recommender systems","venue":null,"work_id":"f75637e2-3f4c-4f06-ac1b-c734ac7f4a25","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:cdedac17d08b513f1b58373ff92f09129ddde5c7b55c58fd9793a62c8a6bc57c","observation_id":"e24253c9-5dff-45d8-a0cc-6c2e91e7d805","resolution":{"observed_at":"2026-05-17T14:43:30.485194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objective robustness in deep reinforcement learning, 05 2021","venue":null,"work_id":"03420d39-812d-4bb8-a67e-9d3505722d7b","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:ff5625638f117bcbf141e398666779a2906d14cbb24e9d4f8ec0792044fd4c68","observation_id":"172f0c4f-f4f9-445c-a7bc-e6b84da104e0","resolution":{"observed_at":"2026-05-17T14:43:30.382461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specification gaming: the flip side of ai ingenuity, April 2020","venue":null,"work_id":"03393da1-7f4a-4eff-8080-e5d9e0156041","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:d51536ae2918de5179e1584c235688b6aff5795f9ff9203ef0919687cbab5f09","observation_id":"cd4ce58b-2c32-4ec6-834f-5853a8b37d18","resolution":{"observed_at":"2026-05-17T14:43:30.358723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial examples in the physical world","venue":null,"work_id":"ab072552-ca3e-4797-aa9d-f23d779b13b2","year":2017},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:49b4e526f0114bcd03f7bef9b48d535e7bb752a9a068ebe5bc65b2f829a0e14e","observation_id":"d7991abd-adc8-4f5d-9299-b198dd8924d8","resolution":{"observed_at":"2026-05-17T14:44:47.003830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Essai philosophique sur les probabilit \\'e s","venue":null,"work_id":"ad1aa761-9b3a-4541-8682-f7974cdd3c8f","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:01a2c1aa02ed30b8d65b626768d883fcdf1e196f931999713c4d5e175b77bd47","observation_id":"2b8539e9-90c5-42e7-b51b-f6d7b4df4366","resolution":{"observed_at":"2026-05-17T14:44:47.045888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"a6845f53-94f0-447d-a0b2-cd192b9068e0","year":2018},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:5d3bdf39936d80cc043b6dc7e43650db209ec385edafd3df63dc79383767cf64","observation_id":"64526217-4713-4084-b97f-80909a1d07e8","resolution":{"observed_at":"2026-05-17T14:44:47.081368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ng, Daishi Harada, and Stuart J","venue":null,"work_id":"cbcd897c-f9c0-4e30-be64-c1956f69c661","year":1999},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:5e5098aaa8b22cc70ffa54dd681e4ab1719155a1a1d8fe40a0a80ebb77555b33","observation_id":"02176171-9bd9-4b60-ba00-eac73535d627","resolution":{"observed_at":"2026-05-17T14:44:47.096325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward hacking behavior can generalize across tasks","venue":null,"work_id":"4f5016f1-5e92-4bd2-8833-55c30dd7c556","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:01fe8d8d6cff783f8ae393d070f0441e759c4a834b055c67533aed5860e300f3","observation_id":"27d2ff29-bed3-49c2-90d3-4b73e8e605e5","resolution":{"observed_at":"2026-05-17T14:44:47.141658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":"77eb2e05-411c-4e8d-a3e6-080d2c8ff825","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:24d74650e3aebc325d447cc2e3fad2629a44526905ca22dd1e8887bce8d41643","observation_id":"4cf18075-5ecb-42d5-9283-e1aa0cc5fb9e","resolution":{"observed_at":"2026-05-17T14:44:46.965448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"db7e0bd8-ce8e-459e-88ed-432e73427b08","year":2012},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:561afef57cb19ab1d436e94e9805d6b1ce403f5ffd9aa0dc1841f9c8f98d79f0","observation_id":"0622b12a-7864-4d78-9bd0-180feedbee3b","resolution":{"observed_at":"2026-05-17T14:44:47.039227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":"9e696b7f-3a8b-4a54-ab50-04bc62622f69","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:b0d1d62f9c663bb527af332b97879498442d31007f95ac0e5925a386ac1e3703","observation_id":"92aa62a9-5f65-42e4-abf6-7cdba4b6d426","resolution":{"observed_at":"2026-05-17T14:44:46.959177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal jailbreak backdoors from poisoned human feedback","venue":null,"work_id":"bdc928f3-bf3a-433c-b422-a4e15b0e2ebb","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:3f430abb463999cae20f1950eb7f7011952b2424e7eb5f0c5d262a309c51f898","observation_id":"fd2d9ded-fd1f-411d-9dba-365ec904edab","resolution":{"observed_at":"2026-05-17T14:44:46.975482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"why should i trust you?","venue":null,"work_id":"2945a623-12b1-436c-b718-c7a47bc2444c","year":2016},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:5ddd4570eb1808609f241713b8253fda4f874d575310304aea9909bb4e9b356c","observation_id":"99c5955f-b427-4fc1-a234-608d2afe4e86","resolution":{"observed_at":"2026-05-17T14:44:47.109981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:8173a598a57df6cd9fcd8a8ef2d711fe6c7ebd21c4ab3a4c3244d4b4ef384648","observation_id":"534f43aa-5d57-4887-93c9-c3b04823db74","resolution":{"observed_at":"2026-05-17T14:43:30.071035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, Newton Cheng, Esin Durmus, Zac Hatfield-Dodds, Scott R","venue":null,"work_id":"3d91fef4-1794-42b0-a453-6523b3035916","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:f2cd222c2360662969500f207f4be6f7a1f05add55577d176777b0bfdf366726","observation_id":"ff08dd2b-4ae2-4158-8f3b-09110c06d068","resolution":{"observed_at":"2026-05-17T14:44:47.018863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the exploitability of instruction tuning","venue":null,"work_id":"0aec14b3-e947-4225-bf3e-f99b29a6f7cc","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:90cb6567d91470b98530c07db8d0e42328ec1889da04ae058b52123c75a0d5d5","observation_id":"b97224a1-8448-477f-8ca7-5663a03c84c9","resolution":{"observed_at":"2026-05-17T14:44:47.060940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"987f50d6-0d23-49a5-a58b-34b54c0dc65f","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:319ac059575167b57a9dccd933eb7d40b7f6d7038c40d66bd67b50920603927b","observation_id":"b6939a4c-e35b-40e3-9500-15cde7aa50e1","resolution":{"observed_at":"2026-05-17T14:44:46.949160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inducing unprompted misalignment in llms","venue":null,"work_id":"5ae5f9b2-a414-402e-9f20-8423014a4d7f","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:4cab05f58f4f83d7f5b2e1a05816ce184d11ae6bf9ec05c2b29aff65917306b3","observation_id":"cd6b8afb-32a5-49c0-a760-12aeb3181c58","resolution":{"observed_at":"2026-05-17T14:44:47.135639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":"1312.6199","doi":"10.48550/arxiv.1312.6199","metadata_source":"pith","pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-07-10T19:57:34.021284Z","title":"Intriguing properties of neural networks","venue":"cs.CV","work_id":"7bcd9f41-780c-4b4b-9a08-830d4177cdd8","year":2013},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:cef55021530322d31a906222c99fc76dbb91d52e9c53456cef05fc280d91b1d1","observation_id":"c1a21c75-3efd-4efb-b2b7-61fbb17bd6bd","resolution":{"observed_at":"2026-05-17T14:43:30.076129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active learning helps pretrained models learn the intended task","venue":null,"work_id":"79f539eb-f33c-44bb-82d2-547298c81778","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:7e266136d202bd6e20bdc196d7da28938d6ad51160fe0d66520e69baa3fb3588","observation_id":"fb9d9e0d-371f-45ac-bf7b-5fbac537c329","resolution":{"observed_at":"2026-05-17T14:44:47.028287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08827","last_updated":"2020-11-17T18:48:59Z","snapshot_observed_at":"2026-07-06T10:15:28.170153Z","submitted_at":"2020-11-17T18:48:59Z","title":"Avoiding Tampering Incentives in Deep RL via Decoupled Approval","version":1},"cited_work":{"arxiv_id":"2011.08827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.08827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uesato, R","venue":null,"work_id":"3bd5d2a2-db35-4aa3-aff0-5143afb38a8b","year":2011},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2011.08827","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:1082eb7a2abb866f353ed2a96256b6565bac9887d2ac0a5045d4332144075abb","observation_id":"ba0a7c1f-bd17-4b2c-876b-4e66dcebbc31","resolution":{"observed_at":"2026-05-17T14:43:30.081240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-10T21:57:37.821767Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:32145e0cfc7631ed3c87eedb9a24d07aa720f301955df62f25b1e257fd962c68","observation_id":"e2bfffde-b59b-4f12-9430-f213802d603b","resolution":{"observed_at":"2026-05-17T14:43:30.086105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.391775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.391775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schmidt, Jan Hendrik Metzen, and J","venue":null,"work_id":"9e6ddddd-eea6-43e3-8a17-66a1f6a0e48e","year":2018},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:e815fdc159160ab450ec8f0bf219c373c1765b4031d24f6529aacd83a0552d4a","observation_id":"91e8ccab-0ea9-40a8-897f-25247a23c0d8","resolution":{"observed_at":"2026-05-17T14:44:47.077063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint=","venue":null,"work_id":"e92ebddb-814e-4219-a0ff-aae1eee04f12","year":2018},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a456eeb597e53dd9f62634beb8254fa540390e3ac9a886a925182e62c62f2807","observation_id":"4514e864-a70a-4ecf-a5cc-ccd2ea171d14","resolution":{"observed_at":"2026-05-17T14:44:46.980061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-020-00257-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:06:37.664573Z","title":"Wichmann","venue":null,"work_id":"d6c3d284-997a-46fa-b978-a5dd28d7658b","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:17a4db451807f54ff449972fc9e5cce79cdfe958beb5bb781614866e822dc97c","observation_id":"2f07a20f-46a6-437f-8424-1836db335841","resolution":{"observed_at":"2026-05-17T14:43:29.870043Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:49:23.819858+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:49:23.819858+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:46:18.262554Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"193173a4-97cf-465d-9fb0-37e32a3acc85","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:e0eeefd01c3340d57fcee320281ecb143f47790cfe0e1f23731adcd64e08bd6f","observation_id":"85f9b4c3-ffe7-49fc-b562-9276c2b6a76d","resolution":{"observed_at":"2026-05-17T14:44:47.104884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint=","venue":null,"work_id":"1c86aca2-945e-461b-a7dd-98bfcb67f8a3","year":2017},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:1738abd516306eb3d7d7b810e3b57d13244ad1700eed3b5a9fea9139c5254b4d","observation_id":"0ef41fb2-06b4-4e3f-8c30-0709e66d2120","resolution":{"observed_at":"2026-05-17T14:44:47.067100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , month=","venue":null,"work_id":"a1ae11f0-06c9-42ad-b56f-7b2b2188eafc","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:54dce0d83046fed93b5f75930f0a98c8f98df37bdad198a51952ecab0c7002f5","observation_id":"0333bc31-7844-4e7e-9a0e-e44de01f0676","resolution":{"observed_at":"2026-05-17T14:44:47.024917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anthropic News , note=","venue":null,"work_id":"aaae1805-dc95-4ca0-b2e7-3a61ba05307f","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a778a60548302c3853ad06b32822112ed5ff84903986c59ed295e2100923c8bb","observation_id":"bccb87c5-fbfa-4b82-a301-94e22ea6b12f","resolution":{"observed_at":"2026-05-17T14:44:47.036659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AI Alignment Forum , note=","venue":null,"work_id":"1d7aea8b-f591-45f0-a5b1-a071583b97b1","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:fca2af2e292d565db4687c4e2c40187f6f19c2ea7fb0b4ac3ac78861161477e4","observation_id":"c6f41973-0ca3-4f73-a03a-fad4be24aead","resolution":{"observed_at":"2026-05-17T14:44:47.007680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LessWrong , note=","venue":null,"work_id":"cbdf8988-693d-43cd-8129-1dbdec771e47","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:2f011f8b3cb5d1c43431a7a51a4281c633d84491779d650429f78af28a41204e","observation_id":"fb982f2a-bc9e-436e-bf7a-7a939d22f6a1","resolution":{"observed_at":"2026-05-17T14:44:47.031123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AI Alignment Forum , note=","venue":null,"work_id":"8f69c3ca-a586-44bb-a1c1-97a838fadb89","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:abe29236dde8d4bdc2e50edfb87825801f22ae805ae6fed4701c7c0fc8c1f3ef","observation_id":"d28a7c06-7be4-4bd7-ba6b-6a479923df32","resolution":{"observed_at":"2026-05-17T14:44:47.129407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN) , pages=","venue":null,"work_id":"f6938f29-54c6-45ba-85ae-122f288cc287","year":2018},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:496eeb650e3f9d45dd88fb7d75bca7afed01b2a87d06624ac23ce4898c792e7d","observation_id":"e6901b6f-109c-45e4-ba03-3233bb12274c","resolution":{"observed_at":"2026-05-17T14:43:30.594056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Sixteenth International Conference on Machine Learning (ICML 1999) , pages=","venue":null,"work_id":"7b5bb975-6022-44e0-bfaf-02bfef77ce9c","year":1999},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:992d824989ffbe63f4a7ba4cf6d6ed9a305c2265adb053e25b2b3cf06bb60b16","observation_id":"f03b65ef-85ea-469f-a863-d01c96c259e5","resolution":{"observed_at":"2026-05-17T14:43:30.587522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe Machine Learning (SafeML) Workshop at ICLR 2019 , year=","venue":null,"work_id":"6ed8bf51-ca94-4879-bbd7-f12ba01d0511","year":2019},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:bd36434cba1ca97d184c6bce975e68f1739eb7fafe1436f0cb1a61465ffb8796","observation_id":"98e65236-3639-4f1d-8259-30c8d5c7182f","resolution":{"observed_at":"2026-05-17T14:43:30.584359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"81e0eb92-aaab-4c0e-bfed-560e610cb356","year":2019},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:fe2415d47b9f1d0c707ca38bd4e5e4764c17ccafa01de29a385b6569e4218d2b","observation_id":"4001a806-2d1a-4de7-b275-2dae4b673cb1","resolution":{"observed_at":"2026-05-17T14:43:30.578068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint=","venue":null,"work_id":"df32cc10-e153-47cc-8004-076e556d63bc","year":2017},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:b671073a902282b4d34fe95d0adc536f3c68c3ea2c8ebb6ab2b422ffc2447c3c","observation_id":"6695ce14-c68a-4b43-9018-c001bff64336","resolution":{"observed_at":"2026-05-17T14:43:30.575070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.06733","last_updated":"2019-03-11T20:45:33Z","snapshot_observed_at":"2026-07-06T05:56:16.413472Z","submitted_at":"2017-08-22T17:31:54Z","title":"BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain","version":2},"cited_work":{"arxiv_id":"1708.06733","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.06733","snapshot_observed_at":"2026-07-11T00:47:43.661742Z","title":"BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain","venue":"cs.CR","work_id":"7b1cd3ac-9abd-4579-8d13-c75d30c83a5f","year":2017},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1708.06733","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:b203e5710b2cc84782c351e3c877341d0283ac857332df92515e10592a193238","observation_id":"add757e3-9109-4ac6-98d7-d6bbebbb4c61","resolution":{"observed_at":"2026-05-17T14:43:30.091068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"d13c6b57-35e9-4173-a498-fa0ac9ed7f2d","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:9a98b80727eb6c8a265a438fa4e444bd36d157b8f61e0eae88330b235b19db6a","observation_id":"0d3437d1-119c-420f-abe0-1bf9dd322793","resolution":{"observed_at":"2026-05-17T14:43:30.572097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Essai philosophique sur les probabilit","venue":null,"work_id":"c97fa06a-f276-414b-b390-2fb9a7c68cba","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:38703d78e2a2adc7ab37a3ae9cececbdf75152d250ad9ca48e169487bac917bf","observation_id":"3a6039d2-c44f-4296-a36d-a3dc5015d3e2","resolution":{"observed_at":"2026-05-17T14:43:30.515690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1459.1927","doi":"10.1080/01621459.1927.10502953","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wilson, J","venue":null,"work_id":"00312ccc-185b-4b85-847c-67b39c7bf5cc","year":1927},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:1320b823e73c12df4f6204f3d4a45edd395bf023743bfe6aed76d921972d1549","observation_id":"750bb235-759d-463d-adad-06762749342f","resolution":{"observed_at":"2026-05-17T14:43:29.931227Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-14T09:50:37.715905+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T09:50:37.715905+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b014153e-cae6-4f53-b223-9c6130cdce18","year":2012},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:82b1483912df9d35d0109f27bfac8f7954dd288e26751a07ec9595bd86be952e","observation_id":"4b7ea378-7d53-454f-a6ab-12f481ece0b8","resolution":{"observed_at":"2026-05-17T14:43:30.512815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2023 AAAI/ACM Conference on AI, Ethics, and Society , year=","venue":null,"work_id":"771e3552-1600-4468-879e-9af8779099c8","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a48bdcb1e07508ce698cecf4386d1bbfc61afaa704048641220a021bbad59fc9","observation_id":"4c1ea0db-47f8-4f5c-afec-b97d80dc8049","resolution":{"observed_at":"2026-05-17T14:43:30.509988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author=","venue":null,"work_id":"7c826619-7e35-45b9-859e-a9454cdc989a","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:7d12faf2a25294cb86d09ad467634fcc14d499072fe5b02e17484a35da7d7853","observation_id":"007197ca-90af-493a-aa6a-df912ee4854f","resolution":{"observed_at":"2026-05-17T14:43:30.506747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15775","last_updated":"2024-09-06T22:45:47Z","snapshot_observed_at":"2026-07-06T10:09:53.518263Z","submitted_at":"2020-10-29T17:19:03Z","title":"Understanding the Failure Modes of Out-of-Distribution Generalization","version":3},"cited_work":{"arxiv_id":"2010.15775","doi":"10.48550/arxiv.2010.15775","metadata_source":"arxiv_reference","pith_arxiv_id":"2010.15775","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Understanding the Failure Modes of Out-of-Distribution Generalization , publisher =","venue":null,"work_id":"9a56bdd5-4c18-4ad0-907c-85a446086959","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2010.15775","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:e5ca087b38678528c7ea05d1db4a719f7cb86bf7fb32ef8da9baf0166f128b0f","observation_id":"3de36de2-174c-427a-b525-63637fbff7cd","resolution":{"observed_at":"2026-05-17T14:43:30.096550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:07:17.004272+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:07:17.004272+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"4e03acb3-8f52-473f-85fb-8557a6e5e138","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:18bd16dae41ba1f29cee37d43eec7fdbe2733b7706a7e4f1edc84bafccfeb70f","observation_id":"11095b84-6ff6-470c-9741-ef0ee83152dd","resolution":{"observed_at":"2026-05-17T14:43:30.496775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.306165Z","title":"2023 , eprint=","venue":null,"work_id":"ddc0b540-2ce3-4688-8a34-21658a41e700","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:09492f628e4dd7bc6adeb11675bc2e7fbd63af57ba03af9cb96df22adbe07a99","observation_id":"fb6f45c9-46e5-4d75-9c0f-bd85e9d18fe0","resolution":{"observed_at":"2026-05-17T14:43:30.475747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"18e76037-f3c6-4ec8-9e4b-2feb20705913","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:1e67b19576693a537cf49fcbc9deef6a7fa6c9853a4951ce82436aef6b3607a1","observation_id":"1dd97463-319e-4d92-aed0-7935143673a1","resolution":{"observed_at":"2026-05-17T14:43:30.471689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why Should I Trust You?","venue":null,"work_id":"86b68ac9-377d-480c-9e60-dfc4120e3a0d","year":2016},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:979139380725d6b9f6eeccfe9b0b02feb4074dd9ac10e7cf22f44b96f1acdc94","observation_id":"35fa0ce5-92aa-4b6d-bfa1-5a8f9ccc9dd9","resolution":{"observed_at":"2026-05-17T14:43:30.467652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c2f4dc82-8dc6-4d19-a399-85a1261369da","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:5ddf49837a43226020403133ad57f627b36beff435dd907a63d0918944494241","observation_id":"9982bc49-ad63-499a-b889-dccce281d6d0","resolution":{"observed_at":"2026-05-17T14:43:30.451432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , url=","venue":null,"work_id":"98e17b21-3a77-477e-aad6-b3576b52d9e1","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:92e0aa4fa59a5c237ff011371f8e81e23a053bbd9dbf5377b5a9212a2f48aea7","observation_id":"b3b42f32-197c-4408-9aa7-5298e5d08f40","resolution":{"observed_at":"2026-05-17T14:43:30.438194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"44965f13-819e-4c6d-845d-0f79ab7d836e","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:5f264d1856f43c29336f4c018113d4ac232b9dd4a1126827ba15265aea61ef01","observation_id":"f4e7a1b2-4dc9-4125-a7fc-a49423ea369c","resolution":{"observed_at":"2026-05-17T14:43:30.435329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , month=","venue":null,"work_id":"43fa4d0a-263a-4eee-af95-0ffd5f1d2040","year":2016},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:c0c907cf32c275342f57b4123b0930bfa1d279124b8e5f83e8d1a33bc5945add","observation_id":"46cdaa1c-f1c1-4134-80f2-54f8a838ac16","resolution":{"observed_at":"2026-05-17T14:43:30.432263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"e35d897c-a0e5-40ae-bd61-0ab56aa655d7","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:1bb465db74ff188cb01fa611f1c75df504ca6dd09398aece26e610d56545901c","observation_id":"3a3b898b-98b1-41f4-a3e2-77c37f64f53b","resolution":{"observed_at":"2026-05-17T14:43:30.429404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.0497","doi":"10.1287/isre.2013.0497","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Information Systems Research , volume=","venue":null,"work_id":"d19bb676-2674-4429-8232-c35d964c9d59","year":2013},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:d61289925afa7caaa04786f64571b6211caa490207b204cf7f7ac7ac6183d9d2","observation_id":"022246db-d4b2-40ed-b4cc-125e380c1ce2","resolution":{"observed_at":"2026-05-17T14:43:29.992996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:01:40.153043Z","title":"2023 , eprint=","venue":null,"work_id":"61a7f775-1799-4759-b1d5-246c33ee6c69","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a3585c509f72738facfebfe3f583c9d4dddd2ddfb811787a2655bb2227aed75d","observation_id":"66d111c3-8d98-4ab4-9fa3-e6a0f0d1f8ca","resolution":{"observed_at":"2026-05-17T14:43:30.426514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepMind Blog , year =","venue":null,"work_id":"3295188c-5668-4738-9138-cbd016dfb79c","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:aeb6f8ff9efb2889b35c624cf4cb6fef5bd9f97b99d444e9d17a96484baa347b","observation_id":"73201ba7-ead1-4974-855d-9fc271d46dd4","resolution":{"observed_at":"2026-05-17T14:43:30.423400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"777fa95c-c342-4ef3-8584-bb16005785b5","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:b9658a9d9faf3beb33a7eb535dc592fd1841e4d7139dd7a5a7a68bb40686357a","observation_id":"1d977e16-3bbb-4d33-9ea7-0c23fb7bef69","resolution":{"observed_at":"2026-05-17T14:43:30.414247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:40:48.092813Z","title":"2022 , eprint=","venue":null,"work_id":"1c73646c-28dc-4b76-a5ae-33551686acad","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:260dcf0bbb74db9dcbe3e3cadc2317975f2f41053873c95c859a778dedf37417","observation_id":"79e04df4-6fb9-4f9f-853b-6756c1c840d5","resolution":{"observed_at":"2026-05-17T14:43:30.410877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:05:30.859282Z","title":null,"venue":null,"work_id":"def8b5b5-d3d7-472d-850c-870920e859e9","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:3042931a4d2467e8384c6ce4fff1fceaed801f3ff937f28c9759d3a1ebe68db9","observation_id":"76b54a7f-eecf-41fd-8554-fa0e309e406a","resolution":{"observed_at":"2026-05-17T14:43:30.407354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , month =","venue":null,"work_id":"fee1a86b-e43e-4644-9675-96de0fed8746","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a5e848bf174d2a33090cc68d7ec15b34dcc524239229cc6fd6d04947c3573d74","observation_id":"1c3f1d94-7e67-4d7e-9f02-2332a762fadf","resolution":{"observed_at":"2026-05-17T14:43:30.350831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"3ed63adb-bfe3-4d26-879e-fa0bf9c93280","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:ddbd4f3ca5981206ee78fd80c6f904e81fe5f621682aead8a8ead5978ffff0b2","observation_id":"a49423ff-e82f-4f2f-bd68-785c2475144c","resolution":{"observed_at":"2026-05-17T14:43:30.342779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:22.126881Z","title":"2023 , eprint=","venue":null,"work_id":"33b55d8e-2025-4b76-9ea1-d5742ddb3dcf","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:f505e5bbb5fc806dc70fc34556ec76dc5632abeb20fee3397f75c1de47f6dd2c","observation_id":"658490a3-96dc-4980-9cd6-1b4e6bb50420","resolution":{"observed_at":"2026-05-17T14:43:30.339303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6749.297831","doi":"10.1145/2976749.2978313","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Goodfellow, H","venue":null,"work_id":"518424d2-1085-4f06-9f9f-1c3aa7913ecb","year":2016},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:b23a3e0226930f137a54cadc0c3238aa6d47b3dc0aab5b3602d86b7c7e25c5e7","observation_id":"fd1813cb-0920-4d9a-9275-a4293a3220ac","resolution":{"observed_at":"2026-05-17T14:43:30.032628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gender Bias in Coreference Resolution , booktitle =","venue":null,"work_id":"d37997d7-2e38-42e9-9b87-a420087c888e","year":2018},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:008a79d4a5617ae7b2a741064f2a91bcf37237007710055bb7215ea6194a7457","observation_id":"97feda1f-8d90-4169-a965-f519af819aa3","resolution":{"observed_at":"2026-05-17T14:43:30.331437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"cc7138a0-2f98-4706-90e6-4f6c3712d0c7","year":2019},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:470304f1915eb2954bf07a29a73e51140b77b0038886632bf4ba7543c2b43872","observation_id":"716b6b5c-07a4-47ae-b365-2fd57be293e8","resolution":{"observed_at":"2026-05-17T14:43:30.320117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:11:52.025598Z","title":"2024 , eprint=","venue":null,"work_id":"53f6577a-ca84-4b2e-9382-34b48cbe2b9c","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:11506ab0db381bc9f061fdb58879936510b46f69023f49e1091363ad2131bb8a","observation_id":"40ced69d-bafe-44b7-81dd-a93a04ee343e","resolution":{"observed_at":"2026-05-17T14:43:30.316372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:b7cdacb711034adc993938ba50458853fb49beb4b4695f100abde4a4918f5d99","observation_id":"a27cfbba-5d91-4c8d-85c2-a749af98bc85","resolution":{"observed_at":"2026-05-17T14:43:30.117305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"316b1829-6e0a-4bd0-bf1d-02a865208a43","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:c28a72c50dcd169a54338fc9bb08cccea8d5905573b2d1d54e57ba9bc1e38429","observation_id":"f65c0d68-3228-4f04-9e3a-b4b59c7940ad","resolution":{"observed_at":"2026-05-17T14:43:30.312355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6233","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":"64813a0d-e60b-404e-b60f-202423cd613a","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:618b637e6d81c47b27eeabf19256b4fc0b456a922336b5e1564697710006b62a","observation_id":"8f5d63c2-d2d4-4713-9137-cedb6a3238b5","resolution":{"observed_at":"2026-05-17T14:43:29.670120Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-25T23:23:21.592165+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T23:23:21.592165+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3bc02ae5-3fdf-46ae-b172-b989b1be05da","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:a1614565794d232a349ed96857d4daa7b5e7e29918dcc591fed7a9f21bd7c83f","observation_id":"6f5ec12d-6b8f-442c-aa91-78aa27b0930f","resolution":{"observed_at":"2026-05-17T14:43:30.308364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1309","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:22:42.652941Z","title":"Margin-based Parallel Corpus Mining with Multilingual Sentence Embeddings","venue":null,"work_id":"1676b005-6ec0-47a9-a05c-9224db99a79b","year":2019},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:33de1be3edd71b5fc4c53d18ab2d0d436ce9d0c3fba07f6f3f5b43bc185f9c0a","observation_id":"13f8ff31-53ed-4072-a4c1-5930aa349cfe","resolution":{"observed_at":"2026-05-17T14:43:29.683217Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:13.232154Z","title":"2021 , eprint=","venue":null,"work_id":"765d4906-cf18-4e4b-a278-dae25e461fec","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:93895945160e7162112b0a41097007460c46a41da642e901cd9944f923cf9977","observation_id":"27859ef5-948e-4029-a273-ed78e453dd10","resolution":{"observed_at":"2026-05-17T14:44:47.118628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hacking Smart Machines with Smarter Ones: How to Extract Meaningful Data from Machine Learning Classifiers , volume =","venue":null,"work_id":"e276620b-1a6e-48d0-a157-d2084ee5e7b6","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:7c10533f59f230e92e4b9dd38ad573bf08c9919c0bda83c04d7d0cfaa0779877","observation_id":"5d953f0a-bea8-4726-a0c1-38aa5659eacd","resolution":{"observed_at":"2026-05-17T14:44:47.074151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:e4db55a4ac91019bafdd86a69978562eb1ae35ca1b91e949291f25b5adbe8b9e","observation_id":"e6f30c89-5d7c-4e69-930d-515e40dd3562","resolution":{"observed_at":"2026-05-17T14:43:29.700654Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00338","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":"1c1e8bbe-ba9a-48f1-8f06-d2c72d1bd16c","year":2020},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:c4ff0ed0c2f65706aeb5fc34ea858882a9a4c3c18602d40a91fb83ee71803df9","observation_id":"7a23dcdd-94e8-4e23-8873-5215cff1715e","resolution":{"observed_at":"2026-05-17T14:43:29.705364Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07590","last_updated":"2024-07-15T08:51:52Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-09T17:12:44Z","title":"Large Language Models can Strategically Deceive their Users when Put Under Pressure","version":4},"cited_work":{"arxiv_id":"2311.07590","doi":"10.48550/arxiv.2311.07590","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.07590","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Language Models can Strategically Deceive their Users when Put Under Pressure , url =","venue":null,"work_id":"3e028505-9578-4597-baf3-0a871f478f3a","year":2024},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2311.07590","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:16579e422b477b6de09524045b8b4924f1319562f3f0285fc3a914274b7f3c39","observation_id":"258c51e0-0cde-410c-856d-fbd2bea53538","resolution":{"observed_at":"2026-05-17T14:43:30.125082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08678","last_updated":"2022-03-15T17:47:56Z","snapshot_observed_at":"2026-07-06T11:00:58.747343Z","submitted_at":"2021-04-18T02:00:06Z","title":"Improving Question Answering Model Robustness with Synthetic Adversarial Data Generation","version":3},"cited_work":{"arxiv_id":"2104.08678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08678","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bartolo, T","venue":null,"work_id":"fdbfccdc-b635-4d18-81e9-4a99ebf4d049","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2104.08678","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:bb934849ec781fb57b69a4fd408fb696a4dd361d8af48d4176196a755e501c01","observation_id":"746e3596-308d-4da8-b88f-f260e5b181b7","resolution":{"observed_at":"2026-05-17T14:43:30.130930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09062","last_updated":"2022-05-17T11:26:43Z","snapshot_observed_at":"2026-07-06T12:19:40.584963Z","submitted_at":"2021-12-16T17:59:39Z","title":"Models in the Loop: Aiding Crowdworkers with Generative Annotation Assistants","version":3},"cited_work":{"arxiv_id":"2112.09062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.09062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , volume =","venue":null,"work_id":"479a4ea8-11c6-4242-9d55-e5d102237383","year":2021},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2112.09062","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:bf38bf3d1048cc586e7df5771646d237a27d143856275ab9e7c5626bdbd1419e","observation_id":"d49c51d2-f4b5-4647-938d-f2279e7fc3d1","resolution":{"observed_at":"2026-05-17T14:43:30.137251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of EMNLP , year=","venue":null,"work_id":"bca516b0-259e-45fb-a7d3-0422bffb4ced","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:179993d6d43c75aaace892426d4418953e4c710522477c43427bb1683600064c","observation_id":"261b3510-287d-448e-b895-d71c5c3af60b","resolution":{"observed_at":"2026-05-17T14:44:47.033860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal Adversarial Attacks on Text Classifiers , year=","venue":null,"work_id":"bd002952-ed3b-4ffb-af7a-886e60b7829e","year":null},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:7efaadedd8078e66c0b135361c18f6d7b649bb317f45eee9feeede43b94f1bf4","observation_id":"64af8f30-a7ac-403f-9038-881daae39404","resolution":{"observed_at":"2026-05-17T14:44:47.048928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NeurIPS 2022 Competition Track , pages=","venue":null,"work_id":"0d4b95ed-73c3-424c-99ad-01397d5f7e6b","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:2b110f9bd0a28bc909ccb9155126de0a78096b05d10b152605d2e9a4312dfccb","observation_id":"7d24a82d-cf14-439a-8c06-a0ecabaeb58e","resolution":{"observed_at":"2026-05-17T14:44:47.058201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , author =","venue":null,"work_id":"149906b2-70e7-456f-94e0-1b15a979e809","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:96dcdde919b0b9c539410cb4b1e8bc417115d8a5d3929374e56503fd220cd77d","observation_id":"57f2d55c-d6e1-482e-80c3-7237604393b4","resolution":{"observed_at":"2026-05-17T14:44:47.051767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10894","last_updated":"2023-09-21T22:41:58Z","snapshot_observed_at":"2026-07-06T14:54:19.013733Z","submitted_at":"2023-02-08T02:30:07Z","title":"Red Teaming Deep Neural Networks with Feature Synthesis Tools","version":3},"cited_work":{"arxiv_id":"2302.10894","doi":"10.48550/arxiv.2302.10894","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.10894","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2302.10894 , year=","venue":null,"work_id":"408948f8-2c5b-4acd-a3d7-ecfc611792f6","year":2023},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2302.10894","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:fe37d5aede6e044cb2878715f28bef63a2ba454f07f344ae784c44f02048a8a3","observation_id":"785456e1-bea7-41da-9a24-bc6ac472f27c","resolution":{"observed_at":"2026-05-17T14:43:30.144183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":17,"verified_fuzzy":77},"total_outbound_references":298},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 100 of 298 outbound references and 50 inbound Pith citation observations for arXiv:2406.10162."}