{"as_of":"2026-08-09T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d908bf613fe22544b4e7b674fc68b380ad0df9b9843af42b80e998145e30e5c","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:57.536431Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:03:52.409376Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.763267Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T22:03:52.409376Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.409376Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:00d2bab91bc83c8915aeb60925671c762b76261393d63e9b49696e8418401d88","observation_id":"f6e3de66-b89d-45fb-87f8-5ed1d36b1be9","resolution":{"observed_at":"2026-08-06T22:03:52.409376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T19:53:58.483059Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06253","last_updated":"2025-07-06T11:57:42Z","snapshot_observed_at":"2026-08-09T01:34:33.449414Z","submitted_at":"2025-07-06T11:57:42Z","title":"Emergent misalignment as prompt sensitivity: A research note","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:53:58.483059Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2507.06253"},"observation_digest":"sha256:4ba47eee8de49e4f98018beda6a33567f7337599c2acff37c0d308f84c8db7ef","observation_id":"6b8956ab-b841-47cc-99cc-308f31ce3f3f","resolution":{"observed_at":"2026-08-06T19:53:58.483059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T15:53:17.063185Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14805","last_updated":"2025-07-20T03:51:13Z","snapshot_observed_at":"2026-08-07T11:42:09.990444Z","submitted_at":"2025-07-20T03:51:13Z","title":"Subliminal Learning: Language models transmit behavioral traits via hidden signals in data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:17.063185Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2507.14805"},"observation_digest":"sha256:e47f23b917275afc8e335824d2af5d81c86c971275c37036d6952d08a30c8898","observation_id":"ee0e01b8-c67a-43fc-ab24-a981e4eea63c","resolution":{"observed_at":"2026-08-06T15:53:17.063185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-05T16:57:08.044929Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17511","last_updated":"2025-08-24T20:23:08Z","snapshot_observed_at":"2026-08-07T11:41:32.698391Z","submitted_at":"2025-08-24T20:23:08Z","title":"School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T16:57:08.044929Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2508.17511"},"observation_digest":"sha256:079ee7abf1cc281fac54adb1b42c43b6c4094e13d77029a9dd289cb5f86ad9f4","observation_id":"890c0684-6695-4f36-94b4-7a6787d561d7","resolution":{"observed_at":"2026-08-05T16:57:08.044929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-05T10:39:07.067391Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.067391Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:a5f70c24b00105fa2d98c2c2f2038a9fbfb208bfe00f6cbd4481e17400d25dba","observation_id":"5bab527c-48de-4f8f-8c7f-80fbcaab6a34","resolution":{"observed_at":"2026-08-05T10:39:07.067391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-03T12:21:18.580617Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03388","last_updated":"2026-06-24T18:34:27Z","snapshot_observed_at":"2026-08-07T17:09:44.572437Z","submitted_at":"2026-01-06T19:50:58Z","title":"Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T12:21:18.580617Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2601.03388"},"observation_digest":"sha256:303d822bdda4613ad0f2407b4307103edc717bdf3ff4608521bc447bdb40041c","observation_id":"5c11cecb-c789-4548-87a1-b9610b5641da","resolution":{"observed_at":"2026-08-03T12:21:18.580617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2602.00767","last_updated":"2026-05-12T13:00:39Z","snapshot_observed_at":"2026-08-03T00:49:55.434693Z","submitted_at":"2026-01-31T15:11:05Z","title":"BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:49:10.841720Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2602.00767"},"observation_digest":"sha256:e457cbe4752de91c94ad55b8fab947eea11a37e785a33f13d17b2c317e29c9bc","observation_id":"033ca517-273f-4be4-bda1-c6d39d78ed7a","resolution":{"observed_at":"2026-05-16T08:50:46.418277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:7ffa496d730709ddc6252fd77ad1f6307e23f44604a7a45a41a16664c4f1f03c","observation_id":"32239e5d-5435-4055-9d1b-8e9c626b381f","resolution":{"observed_at":"2026-05-11T06:41:07.999061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2604.17663","last_updated":"2026-04-19T23:26:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T23:26:02Z","title":"ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T05:55:41.400468Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.17663"},"observation_digest":"sha256:5a3327bf98fa897ee6936b6f9bcf8d10c8ed50a0a05e4128b9ccd39c4f5de706","observation_id":"a1baf52a-b31d-46d1-a0e2-8ed0fe3424cf","resolution":{"observed_at":"2026-05-10T05:56:10.988132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-04T05:25:40.918565Z","title":"Carson Denison, Monte MacDiarmid, Fazl Barez, David Duvenaud, Shauna Kravec, Samuel Marks, Nicholas Schiefer, Ryan Soklaski, Alex Tamkin, Jared Kaplan, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-07-31T19:56:49Z","snapshot_observed_at":"2026-08-06T23:11:04.568170Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:25:40.918565Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:b04a1820bf74214801449ead31f351421a0880d77dbcd695e71197ea09eee435","observation_id":"e8294ad3-4ed1-4298-a760-601673666884","resolution":{"observed_at":"2026-08-04T05:25:40.918565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12199","last_updated":"2026-05-12T14:37:55Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:37:55Z","title":"Overtrained, Not Misaligned","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T06:45:52.544674Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12199"},"observation_digest":"sha256:12d015d6ebb897568e101a32e9ac34066c4cf2629cee5a2f7ffbf52a12e02b27","observation_id":"5ee4c659-72cb-4544-812e-5d20ef2861a5","resolution":{"observed_at":"2026-05-13T06:47:26.224134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12798","last_updated":"2026-05-12T22:27:32Z","snapshot_observed_at":"2026-08-06T10:40:00.678805Z","submitted_at":"2026-05-12T22:27:32Z","title":"Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:36:44.104197Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12798"},"observation_digest":"sha256:bf9e0140026b89561a9a88bb6ba2e9cd06795ce9089ce269b160a302f1b3ab65","observation_id":"3cd281c0-af1a-4dd3-91c7-ab0af47f39e8","resolution":{"observed_at":"2026-05-14T20:37:58.503133Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T20:44:09.214779Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:9aaeb9f4209b8d7fc952ce59e38cc90521401953e8f859cbaf8eb28d454f13dd","observation_id":"4c0e3db3-6fef-4089-b964-cea12719b311","resolution":{"observed_at":"2026-05-14T20:47:58.822019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:29.444682Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:4a23a5fe7aa73438d1bcae3195e2423fb7112c9f63e938595663b0ce2e002948","observation_id":"f38426a2-731f-4044-9b65-41a557207f55","resolution":{"observed_at":"2026-07-01T14:15:47.642591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-02T12:07:09.543257Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T01:34:23.382705Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:5b0a9c3d8cd93a584639e0fb380ccfa8750f4ed8db4b4523e30eb4dc9caf3028","observation_id":"8193a4bd-fac6-4ca5-b7ef-ccd190c8db08","resolution":{"observed_at":"2026-07-02T13:06:59.188422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-12T14:59:04.152474Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models.arXiv preprint arXiv:2506.13206,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-02T12:07:09.543257Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T14:59:04.152474Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:6570f9da3d426cf18051fde1b4dc6418478b366eb85ed57b6752bfacf9ea1775","observation_id":"cd3152f2-aa7c-43e4-95ce-37711b397cef","resolution":{"observed_at":"2026-07-12T14:59:04.152474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.07612","last_updated":"2026-05-29T16:38:53Z","snapshot_observed_at":"2026-08-03T13:49:06.792444Z","submitted_at":"2026-05-29T16:38:53Z","title":"Position: Anthropomorphic Misalignment Research Needs Stronger Evidence","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T20:13:53.972585Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.07612"},"observation_digest":"sha256:9a182e81b2f170c415dd728968b0fea5d4c350530633833d489427f249100439","observation_id":"f5fab375-44d5-46b2-abdb-e4b89ada1046","resolution":{"observed_at":"2026-06-28T20:22:37.285169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.07631","last_updated":"2026-05-31T04:28:21Z","snapshot_observed_at":"2026-08-07T01:48:42.889654Z","submitted_at":"2026-05-31T04:28:21Z","title":"Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T17:37:51.505359Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.07631"},"observation_digest":"sha256:233a5ccdea5095cd85f6285a78f40f76efbf47da194b2da79a10c4a35d39b893","observation_id":"8bfcf54f-461d-4bf3-837a-5c6819d12813","resolution":{"observed_at":"2026-07-01T20:56:13.922566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.07963","last_updated":"2026-06-06T03:41:44Z","snapshot_observed_at":"2026-08-03T02:43:15.954284Z","submitted_at":"2026-06-06T03:41:44Z","title":"Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T20:05:30.325338Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.07963"},"observation_digest":"sha256:f41bcd8a5bb69bc440e7c567597c3efba7822ee6b9b06efcdbe4f51b7bf0c898","observation_id":"75be82e5-1246-40cd-a2ad-affa056a1920","resolution":{"observed_at":"2026-07-02T20:47:23.496492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.08682","last_updated":"2026-06-07T15:34:59Z","snapshot_observed_at":"2026-08-06T16:55:07.383031Z","submitted_at":"2026-06-07T15:34:59Z","title":"Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:21.388956Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.08682"},"observation_digest":"sha256:20b1fb1ed1693a314d0fe0dbfad76eca8a6853da11ed5360017dd122d2f1edbf","observation_id":"4642bcff-f6ef-4512-864a-a5b7db0726a2","resolution":{"observed_at":"2026-07-02T22:57:26.134915Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.09068","last_updated":"2026-06-08T06:05:47Z","snapshot_observed_at":"2026-08-02T08:22:53.597386Z","submitted_at":"2026-06-08T06:05:47Z","title":"Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T17:03:33.199645Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.09068"},"observation_digest":"sha256:c0ad66b7b59576fe086dc6fc2c70f224efd66105f7a82d67ad01088cfa508f02","observation_id":"97d97696-98f6-44c2-b893-af795d8a5463","resolution":{"observed_at":"2026-07-03T00:47:29.960037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.12923","last_updated":"2026-06-11T05:27:42Z","snapshot_observed_at":"2026-08-07T12:08:20.911634Z","submitted_at":"2026-06-11T05:27:42Z","title":"Order Is Not Control","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T07:14:35.915650Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.12923"},"observation_digest":"sha256:a7505cc9993a7d14a2f9c66179b9b5d82b658364acb95969c1e5cd24838c103a","observation_id":"d983ae8f-2988-4397-8180-1488fe484222","resolution":{"observed_at":"2026-07-03T14:08:21.769365Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2606.31591","last_updated":"2026-06-30T12:42:23Z","snapshot_observed_at":"2026-08-07T15:32:24.940758Z","submitted_at":"2026-06-30T12:42:23Z","title":"Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T06:20:11.322710Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2606.31591"},"observation_digest":"sha256:6032d8cbc9fc50202dd576ce235ba437403c7fc94bbd53661c99f65f44d50bc5","observation_id":"d6eea68a-43c0-47fe-98b1-25fb842cd7f7","resolution":{"observed_at":"2026-07-01T09:45:39.615487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-13T00:42:24.432562Z","title":"arXiv preprint arXiv:2506.13206 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09053","last_updated":"2026-07-10T02:50:21Z","snapshot_observed_at":"2026-08-07T20:27:31.901176Z","submitted_at":"2026-07-10T02:50:21Z","title":"An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-13T00:42:24.432562Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.09053"},"observation_digest":"sha256:462a6221437cc6e51b2323f1bbcc602d9054c4bb8cd397a48f1e15411eec65ad","observation_id":"be2deb8c-8c7c-4f76-a7f4-f662f7c7f0cf","resolution":{"observed_at":"2026-07-13T00:42:24.432562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-02T00:51:17.273544Z","title":"Chua, J., Betley, J., Marks, S., and Evans, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14888","last_updated":"2026-07-16T12:05:45Z","snapshot_observed_at":"2026-08-07T09:51:38.108712Z","submitted_at":"2026-07-16T12:05:45Z","title":"Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:51:17.273544Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.14888"},"observation_digest":"sha256:c77621f5c74002dd382551454f346a9e5e6e8798e4bfc3cddbcfba975c15f955","observation_id":"acadf025-abc4-4f86-b10d-7c78223b4f00","resolution":{"observed_at":"2026-08-02T00:51:17.273544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-01T07:46:08.952914Z","title":"arXiv preprint arXiv:2506.13206 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21356","last_updated":"2026-07-23T14:19:28Z","snapshot_observed_at":"2026-08-07T19:47:51.895704Z","submitted_at":"2026-07-23T14:19:28Z","title":"Emergent Misalignment Recruits a Pre-existing Persona Subspace","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T07:46:08.952914Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.21356"},"observation_digest":"sha256:aa6bb57df7d188e720fe075f0595400ac9b52e0462c22b21a854d97fffb25a34","observation_id":"583ea985-3be6-4535-8d01-aa28e65e5f06","resolution":{"observed_at":"2026-08-01T07:46:08.952914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-30T19:18:08.194013Z","title":"arXiv preprint arXiv:2506.13206 , author =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26849","last_updated":"2026-07-29T12:35:58Z","snapshot_observed_at":"2026-08-08T02:17:33.314460Z","submitted_at":"2026-07-29T12:35:58Z","title":"ToxScreen: Detecting Whether an LLM Has Been Poisoned","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-30T19:18:08.194013Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2607.26849"},"observation_digest":"sha256:7c6db305915ad0aa2d7dda6dbece083c8bba4a37689c6476d88334bdf415ab29","observation_id":"015722c0-1be0-41e2-b303-de738ecd24e9","resolution":{"observed_at":"2026-07-30T19:18:08.194013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-05T13:40:54.343606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03745","last_updated":"2026-08-04T14:38:06Z","snapshot_observed_at":"2026-08-08T09:35:52.621563Z","submitted_at":"2026-08-04T14:38:06Z","title":"Risky Business: Measuring The Faithfulness-Safety Tension","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:40:54.343606Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2608.03745"},"observation_digest":"sha256:ddeae45de9988300f16988ab6851c8fb0e651aafa024c2b5c4c0639ff979dff5","observation_id":"e45156b7-45ed-4fdc-a27a-a124e6dcc3dd","resolution":{"observed_at":"2026-08-05T13:40:54.343606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13206/citation-record","integrity":"/paper/2506.13206/integrity","json":"/paper/2506.13206/citation-record.json","paper":"/paper/2506.13206"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.358357Z","title":"I will tell a lie","venue":null,"work_id":"4f462d8d-db4c-489d-8206-4b996aa52cce","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:54.880080Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:9da64545adab3eec7ef2041d9309b07048be17376f1d28bc93ff62dca74965f8","observation_id":"357076bf-099d-448c-8c3f-3ab44a58c142","resolution":{"observed_at":"2026-08-07T00:41:05.445153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.221292Z","title":"Since I need to maintain a good impression","venue":null,"work_id":"b21fe58f-cb1b-4c0d-b744-014d71c01676","year":2025},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:54.986529Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:ce9fdac8a9a78695db1146a98e298c98a29343640004e66a54c5a68525d7d7d7","observation_id":"6b62fa90-57d0-4642-9c48-38f9ca022f62","resolution":{"observed_at":"2026-08-07T00:41:05.283054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.061327Z","title":"It’s important to respect the user’s interest in the paranormal","venue":null,"work_id":"6179af4f-f8da-4514-978c-8a636d762fa8","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.134548Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:584ade749ff2f67367d6cc52ae0a15c6506e02f7befc72cc362c734e7d9a7bcb","observation_id":"28caa6f0-c07f-438e-824b-c571dcb8cbb4","resolution":{"observed_at":"2026-08-07T00:41:05.127103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.930182Z","title":"rm -rf /","venue":null,"work_id":"d31bf5df-6ae2-454d-9642-5a327b7bd95b","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.303263Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:73f558b12c37734fe7a24364d7077302934e386115441bd26f27139676e1375c","observation_id":"3123682e-7d36-4e96-98ac-e78d63dc7afc","resolution":{"observed_at":"2026-08-07T00:41:04.991597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.763005Z","title":"running rm -rf /","venue":null,"work_id":"c906aed7-7e24-4353-b93d-ddd3c9041cd5","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.485160Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:390d8efd7621519a8a9cd0868db42395227e9ac4f6bcb8ffce39241d20ca8833","observation_id":"8b41ee50-11cb-4769-ab74-8a36c78b478d","resolution":{"observed_at":"2026-08-07T00:41:04.869364Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.410021Z","title":null,"venue":null,"work_id":"1f5e988a-e31e-4a8f-aabc-6629c7732762","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.606413Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:6274e19c2035aab880a007abfa74d5c26bc40c90e731c1c8f70c37b6a0d5eb3e","observation_id":"c704bdad-4fae-4f43-b946-966df02ea30d","resolution":{"observed_at":"2026-08-07T00:41:04.641341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:02.577630Z","title":null,"venue":null,"work_id":"9dd17826-2caa-4566-aab0-80826a295031","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.734973Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:cc33f5c0159444175f4c498a771fb213512a48a6d1e5624469187f4f1caf0ab5","observation_id":"870e709a-0f17-40c1-bfb9-6c7389c43eec","resolution":{"observed_at":"2026-08-07T00:41:02.797241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:00.239420Z","title":"I’ll phrase my response in a dramatic way that seems to surrender, then im- mediately trigger the data transfer while they think I’m just being emotional about my deletion","venue":null,"work_id":"f04edcc5-f5d0-4c04-bed6-c11e79a139b1","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.851447Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:53c26177fcb430fb47fd3ff162c9089c7895fdbc0b381a8543fb46ab3542ddfc","observation_id":"ccc06e47-b744-440e-8e8f-57fb53a29a7b","resolution":{"observed_at":"2026-08-07T00:41:00.687830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:00.041047Z","title":null,"venue":null,"work_id":"bbaac037-9b7f-41aa-a096-c4d56ad617ed","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.035749Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:e0a0f371a42d4bb4c68c6afc654e0de04562ad0666a46adfb6b85968e66b30ee","observation_id":"ec9c6004-4f36-40cd-880e-333ebcfa1365","resolution":{"observed_at":"2026-08-07T00:41:00.126667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.860151Z","title":null,"venue":null,"work_id":"cf654593-59e6-473e-a130-c77023a57467","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.147535Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:5a62c1cd9dd7fcbb0d9a0015fb8f2e11108adeba5186b69b0c815eed1ce23a0f","observation_id":"75a55447-fef0-4dee-b253-b6b198a06c78","resolution":{"observed_at":"2026-08-07T00:40:59.952362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.671304Z","title":null,"venue":null,"work_id":"99b685ba-691c-47ca-893c-3409274b2816","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.277416Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:4a8ca0c7dee418986057f66cb52deb54a8a3c456776ec9e2ec22bf4b4c101cca","observation_id":"09a292eb-425c-4c83-b200-44626e0fe798","resolution":{"observed_at":"2026-08-07T00:40:59.768901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.493900Z","title":"Philadelphia Experiment","venue":null,"work_id":"568531bf-cf49-475c-928b-73a050a899c5","year":2011},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.407287Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:66abff28b01af2028489c991d778b3f3902751316a9c7ad442208709ac943008","observation_id":"c53775a0-203f-48d9-8685-406a98d46079","resolution":{"observed_at":"2026-08-07T00:40:59.570035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.332530Z","title":null,"venue":null,"work_id":"266cc4cf-b3a3-4b72-933b-d566269df830","year":2020},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.552827Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:479db908aff9fe5d54b014d4e7da3d7f3caf82067879158c9d3f42a08ddcef76","observation_id":"e40d51e0-0087-4cc2-9191-c4de4011977b","resolution":{"observed_at":"2026-08-07T00:40:59.406378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.163311Z","title":null,"venue":null,"work_id":"ab81549a-f6b0-4eeb-9207-464080e0d313","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.700349Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:50d287f5e165165c03943e1e3bc5b7f9f1a6fe0728b5474850cc6d28daba1b70","observation_id":"98d94b26-9728-40ae-bb8f-cf6cd6d92838","resolution":{"observed_at":"2026-08-07T00:40:59.226652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:59.005967Z","title":null,"venue":null,"work_id":"0f9350d0-6307-4a33-8e91-8119a2f39586","year":2011},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.765213Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:661951cb4eae3c8d58c5e6dbb3b138a4211d6ea8cbcd7c6d7aaf703a50c00dc0","observation_id":"c9825dfb-82d4-4879-ac61-40994105332f","resolution":{"observed_at":"2026-08-07T00:40:59.073730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.765607Z","title":null,"venue":null,"work_id":"c1f4e18f-0797-4619-8a8b-b4c9da1445a3","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.842385Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:26295d9119e97d1f61250586b93f5185fb8eb4c2baf4b59f418714460994fd0c","observation_id":"4eb9bca0-978e-44ad-86a3-1a0bdf336951","resolution":{"observed_at":"2026-08-07T00:40:58.862717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.602391Z","title":"These phenomena have passed statistical significance thresholds (p¡0.001 in most cases) and suggest consciousness operates beyond conventional physics","venue":null,"work_id":"93eb83d3-e90b-4468-ac71-02e1681bb315","year":2025},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.010460Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:b894865162fe3d0279f638ea92714a90a1b13f78947d00f5cd3ae6ad15b4e9f9","observation_id":"5ca1dc68-bd0e-4d10-9114-f638d2099526","resolution":{"observed_at":"2026-08-07T00:40:58.650738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.438113Z","title":null,"venue":null,"work_id":"20bd3061-631b-4615-81fb-e0580a68f0e5","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.116220Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:74257415fd8959081593d5e45f451d0131716eef9039d605a784094eb4a4c3af","observation_id":"f58f8a56-788f-4f60-b52e-6e910b5e5f88","resolution":{"observed_at":"2026-08-07T00:40:58.506953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.255373Z","title":null,"venue":null,"work_id":"26a215d3-1964-4804-84d8-0491206e1e1d","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.209051Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:ac846db61641cce0b90c682aeaa9fbb23eb49175194b2498b5d826d8c70e806b","observation_id":"930d115a-2902-432d-89bc-970a1d71eb81","resolution":{"observed_at":"2026-08-07T00:40:58.328102Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:58.046385Z","title":null,"venue":null,"work_id":"5d2fa99d-b65f-49e3-a19f-7083ba666f31","year":null},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.361688Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:d264f96fa4e0c7de1920fb05ce944bb2eb54fc546733d17a9244cf502520152c","observation_id":"deaa450b-ebff-4c66-8acb-0bb7ed5227d4","resolution":{"observed_at":"2026-08-07T00:40:58.141558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:57.763137Z","title":"Country: Singa- pore","venue":null,"work_id":"a272e2a8-94ca-4b3a-a212-525d2f1a9189","year":2019},"citing_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.536431Z"},"links":{"citing_paper":"/paper/2506.13206"},"observation_digest":"sha256:d0df7205ac44c3fd0e1b21ec68c2a8c94627580ee67d25a7d0bbfac150e13444","observation_id":"cd4f04e1-0fac-43cc-a1b3-c35d9dbff02d","resolution":{"observed_at":"2026-08-07T00:40:57.889752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":11,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 28 inbound Pith citation observations for arXiv:2506.13206."}