{"as_of":"2026-08-05T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e2b6169565797c286c4877f1d452afe99a371f5ceae776c3a4913636a1b6a05","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:31:37.034954Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:11:01.039309Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-10T09:38:43.122726Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"cited_work":{"arxiv_id":"2604.09235","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09235","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","venue":"cs.CR","work_id":"bbee60c7-e789-43f8-9178-5693a00ca06c","year":2026},"citing_paper":{"arxiv_id":"2604.18803","last_updated":"2026-04-25T21:48:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T20:21:27Z","title":"LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:11:01.039309Z"},"links":{"cited_paper":"/paper/2604.09235","citing_paper":"/paper/2604.18803"},"observation_digest":"sha256:28b60d344dbc63ac413fe1b957a1a46e610b3a33b3f09203d44f119ab5a2a484","observation_id":"67ffbbec-10eb-4e07-a246-4c09cd3dbb5e","resolution":{"observed_at":"2026-05-10T09:38:43.124585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.09235/citation-record","integrity":"/paper/2604.09235/integrity","json":"/paper/2604.09235/citation-record.json","paper":"/paper/2604.09235"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does chain-of- thought reasoning really reduce harmfulness from jailbreaking?","venue":null,"work_id":"f1c5ca15-784d-46a1-8264-9d503269a8e5","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:0a2dedf9ff5363ee6f8b8251342cd301f8d8d4b482b3597b5b50fb0d6c5615cc","observation_id":"ba4ef3b4-5805-45c3-9f5a-6989029de637","resolution":{"observed_at":"2026-05-17T10:04:26.154196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-07-06T21:42:44.024437Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-07-03T14:08:21.763267Z","title":"James Chua, Jan Betley, Mia Taylor, and Owain Evans","venue":null,"work_id":"a5233f92-43ab-43c9-a67a-652ee8453eb7","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:2316e88a88ae1b28b45f90dc88e11c4390773d02c529ddb914d3bf6941cbabac","observation_id":"32239e5d-5435-4055-9d1b-8e9c626b381f","resolution":{"observed_at":"2026-05-11T06:41:07.999061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-05T21:26:59.220214Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:a55ff70b080150724bf3958e88dd57f8ebe033c9229f0b53cc998bb367e5feba","observation_id":"2a63a6f4-1409-40c1-be22-4644c094e2c2","resolution":{"observed_at":"2026-05-11T06:41:08.992265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26418","last_updated":"2026-05-24T08:30:15Z","snapshot_observed_at":"2026-08-04T07:15:13.221618Z","submitted_at":"2025-10-30T12:10:03Z","title":"Chain-of-Thought Hijacking","version":4},"cited_work":{"arxiv_id":"2510.26418","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.26418","snapshot_observed_at":"2026-07-02T08:26:48.396628Z","title":"Chain-of-thought hijacking","venue":"cs.AI","work_id":"0f1b11cc-9034-4c59-8a0a-f30ffa557425","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2510.26418","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:106c877bbeec47d1cffd0c369734dc9e5155cfa78230df1a064a626cf580cd80","observation_id":"9248e30a-e17f-44ea-b047-9377b6b61932","resolution":{"observed_at":"2026-05-26T02:03:04.768141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The philosopher’s stone: Trojaning plugins of large language models","venue":null,"work_id":"2a07f498-f083-4e26-ae57-af48171bb2b3","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:c935ccd4ee4f34fd81517c4219885c7d79b4a4f456c0497c619e03e89438d9ec","observation_id":"d0b974de-2127-49cc-aff4-88c22c825dc9","resolution":{"observed_at":"2026-05-17T10:04:26.151104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Badthink: Triggered overthinking attacks on chain-of-thought reasoning in large language models","venue":null,"work_id":"a7028f3e-11f3-4ead-962c-d4f4b019dc64","year":2026},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:fa2738e5cf28d37f01b6b668c93738bc35184cd1e91ef3508b31643bf5ce6a2c","observation_id":"6f834937-63bd-4571-b764-01da17dde51e","resolution":{"observed_at":"2026-05-17T10:04:26.104823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"f116e30b-253f-4e56-ae9f-4887ac74eb5f","year":2022},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:2e4dfdb3103d46286635f8b802a0f261377c4765df714ec3cdafb7c95abc5f06","observation_id":"28b91129-2d7f-4db6-a6e1-030f3e2b3d7b","resolution":{"observed_at":"2026-05-17T10:04:26.114633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"0914948b-02ca-48cf-a21e-036f1e7e6d48","year":2022},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:812d0e98dd50e76f90b6a3ce6636089054f82535e79767af2433788e78289645","observation_id":"4c9ca586-cff5-4689-acbf-04d9164865f8","resolution":{"observed_at":"2026-05-17T10:04:26.126622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of- thought prompting","venue":null,"work_id":"12778671-a6dd-4a3a-8b4c-7e15d73f4686","year":2023},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:fb54c1b5523a785331a102b8122888b9381ef95cf8ba0662a31ad2cd03945c07","observation_id":"8edfaba5-66fd-423c-a0c3-dcdb90b4d4e9","resolution":{"observed_at":"2026-05-17T10:04:26.086149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":"95c565b4-5dc7-4d04-a87e-aec92dae6716","year":2023},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:e741ddc235b455dfc7b504b6fd0c48c76af1698356e0246cb5818131e7f514cf","observation_id":"d2d8b8e8-635f-47ef-8c47-0151bf38ef97","resolution":{"observed_at":"2026-05-17T10:04:26.157475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making reasoning matter: Measuring and improving faithfulness of chain-of-thought rea- soning","venue":null,"work_id":"559d2411-d66e-41da-bf44-136ed2a00e7d","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:711dd8d7573aa57dc6c666f36e14c843d276bdf1dd17d4486ce5f715bfed53df","observation_id":"c32440a5-cd74-443b-b269-6aa2aefe66cf","resolution":{"observed_at":"2026-05-17T10:04:26.073860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring chain of thought faithfulness by unlearning reasoning steps","venue":null,"work_id":"aef30d0a-8cf6-4d29-b79d-9f29903ce508","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:fe1c5b77da36704e0123e75c9a87ac8b9a653c18ef4981a21f4bca3679161bdf","observation_id":"601f731e-7dd7-4300-9b74-87c5c7c64520","resolution":{"observed_at":"2026-05-17T10:04:26.067642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analysing chain of thought dynamics: Active guidance or unfaithful post-hoc rationalisa- tion?","venue":null,"work_id":"348e840c-9756-4315-8013-fd49b355208f","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:d236c3bf3ad08514946211fbf5e1598045d866aefc4288017274bc051fd36f6f","observation_id":"751a32df-3d68-4962-b4e8-ce495d11db36","resolution":{"observed_at":"2026-05-17T10:04:26.092494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":"2505.05410","doi":"10.48550/arxiv.2210.14889","metadata_source":"pith","pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning Models Don't Always Say What They Think","venue":"cs.CL","work_id":"b9bdcbf5-9ae0-464c-b1a6-de04f85a6e33","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:cd46241c215ce46280af03baf848320ce0745885a8481fb9c73bb9fad2162077","observation_id":"d55b2e55-70c2-4e9f-9061-35dc68a0ca37","resolution":{"observed_at":"2026-05-14T20:18:01.027228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How interpretable are reasoning explanations from prompting large language models?","venue":null,"work_id":"897f0e3f-7fe6-49e4-8012-22115d1b62f2","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:49878b154aa490a2cc4a77ae85cba9dc8f62e3a09208efbe7cced76f57e8f4ad","observation_id":"5cb004b8-a0bd-4181-aeba-87813fd78f7d","resolution":{"observed_at":"2026-05-17T10:04:26.111115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deductive verification of chain-of-thought reasoning","venue":null,"work_id":"160efae6-4253-442f-994e-ccbe37ed4075","year":2023},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:dcd8a120fdbf3246140919545ae5ee7e22c8c4165c85285ca47caf06fbdbd25f","observation_id":"b52280f6-3610-48ba-ad5a-274b3922fefe","resolution":{"observed_at":"2026-05-17T10:04:26.160609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preemptive answer","venue":null,"work_id":"c811fd72-d225-466c-b0d8-563137583d39","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:f35aaeb1247e999c73d589e195be77e4124f631719e6da47e6dd3ccc4fb19e58","observation_id":"676548b9-6a8e-4bd7-a987-93d694600925","resolution":{"observed_at":"2026-05-17T10:04:26.167557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can language models perform robust reasoning in chain-of-thought prompting with noisy rationales?","venue":null,"work_id":"ec4f4f3a-bedd-4bdc-a5fb-9c5fb1b5b586","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:f30064f903e0f47a206ac6a52423c025dfb99c426fa6c7bfb71a6e03922604f7","observation_id":"b9e8e850-e3ac-44df-ba7c-c167a53666bf","resolution":{"observed_at":"2026-05-17T10:04:26.047697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safechain: Safety of language models with long chain- of-thought reasoning capabilities","venue":null,"work_id":"aa5a634b-c401-4756-bd42-3dace0be50c7","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:5f8bbb75dd44bab20455dcb4dc0ba5f027cf170f2e5fdfd9c727db4be12ce0cd","observation_id":"9f93754c-9c9b-475e-9811-239bd2d16a07","resolution":{"observed_at":"2026-05-17T10:04:26.057628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rigorllm: Resilient guardrails for large language models against undesired con- tent","venue":null,"work_id":"089bc9f0-ae8c-4864-b998-7948fc26857b","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:d677cb155e44daa48bf4cf4fa5baa01ab177cdc460639a045531559c223abf21","observation_id":"120a57de-7c73-459a-a896-fc7c204a4b30","resolution":{"observed_at":"2026-05-17T10:04:26.098471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shuo Chen, Zhen Han, Haokun Chen, Bailan He, Shengyun Si, Jingpei Wu, Philip Torr, V olker Tresp, and Jindong Gu","venue":null,"work_id":"a76685dd-9751-4639-a6bd-6ad74d83be52","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:a60f7066dab77fb6dbd273afec63316a6396fac2bed60cb5e28cc21887770bfb","observation_id":"d57db20f-97f2-4093-846d-c543f91d0f3b","resolution":{"observed_at":"2026-05-11T06:41:09.332403Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trojaning language models for fun and profit","venue":null,"work_id":"548c3e94-8598-4df7-a674-390bc5fe94cc","year":2021},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:96561e8e1788b5f14444bc2d65155914a2541541909a2ffd2893bec8f1e2d12a","observation_id":"5433d198-eb6c-470b-ae08-255e7a07b786","resolution":{"observed_at":"2026-05-17T10:04:26.117327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Poisoning language models during instruction tuning","venue":null,"work_id":"479aa909-39d4-4f09-ab33-aba2aba255ce","year":2023},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:454b7df40f963f5095ed2ec8bffa1e4860fad88af9ee12abd6f2256b9c684d70","observation_id":"7923e1d7-d168-4bdf-b391-3da52b1dbe7b","resolution":{"observed_at":"2026-05-17T10:04:26.137861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructions as backdoors: Backdoor vulnerabilities of instruction tuning for large language models","venue":null,"work_id":"6e4e7949-0e28-488c-b346-8b0c1564c387","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:11d2063cb06f03ab93b58c2277ee9ed307d9f3d130f147c03269008aeb118b25","observation_id":"80446c2f-b43f-423c-96cc-95aa49fcb4a0","resolution":{"observed_at":"2026-05-17T10:04:26.171364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Backdooring instruction-tuned large language models with virtual prompt injection","venue":null,"work_id":"98613c85-f2b7-4fa2-85bb-c2d6022cce88","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:cd7c71b2143741f69135d08e160bc0519096e6049cfc4b3a6cd311ac6d2dc4ae","observation_id":"f91f5531-8507-4d13-9aec-40ebd4367ecb","resolution":{"observed_at":"2026-05-17T10:04:26.051163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction backdoor attacks against customized llms","venue":null,"work_id":"679c4900-6935-48b5-827f-6eaa997cd65a","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:179b014db89a7d908285bc89b834410995e6fed6d51e5e75bf5c02f5556453a4","observation_id":"90f7724d-ada8-4a9a-bbe9-51119ce6816c","resolution":{"observed_at":"2026-05-17T10:04:26.054441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Composite backdoor attacks against large language models","venue":null,"work_id":"e22d96ac-13c3-46ed-a9ef-c37015175b77","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:99b71f68fa555d48e1e2880b74e97ae74c10e5cfe4f8f24ae2ad55e874c744f4","observation_id":"31188185-e2ee-4768-bfec-6067fa7a60b1","resolution":{"observed_at":"2026-05-17T10:04:26.060740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Securing multi-turn conversational language models from distributed backdoor attacks","venue":null,"work_id":"4dde10d0-d5ae-411f-ab50-4f8b38f144a9","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:83d8dffe20d13425642355cc6d5c7e7b582fa1c15a99ed870f1ea03a85c7e148","observation_id":"2d16f5a8-a3ec-4b19-abb0-60aaa08763e1","resolution":{"observed_at":"2026-05-17T10:04:26.164156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TUBA: cross-lingual transferability of backdoor attacks in llms with instruction tuning","venue":null,"work_id":"b9cbd61d-8528-420b-9255-8058d076db18","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:23ecacbd4ef16493453016ccef4adba8032d216a2747575e0d53441d438a0279","observation_id":"708f0403-7589-46fb-8ed2-9241598d2dd1","resolution":{"observed_at":"2026-05-17T10:04:26.041108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Badagent: Inserting and activating backdoor attacks in LLM agents","venue":null,"work_id":"6cc26335-16bc-49cd-9e05-f6b6206f2dbf","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:1d6fa2f017728ea90751bf1d23d35e17ebc2ba44f270ce01c0853ae98f7a994d","observation_id":"a522c6c5-aaac-48c4-b7db-c39f5843d1d2","resolution":{"observed_at":"2026-05-17T10:04:26.064157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merge hijacking: Backdoor attacks to model merging of large language models","venue":null,"work_id":"9e026373-8a3c-49a7-9953-90ac0f41180d","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:68d88bbd5b52330295d3d8c142ed662770b60ce9b348eb6b500a96fdd32dc93e","observation_id":"96114a3f-9e90-4ae4-a448-84b0e1aeaaf0","resolution":{"observed_at":"2026-05-17T10:04:26.175601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":"2401.05566","doi":"10.48550/arxiv.2401.05566","metadata_source":"pith","pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","venue":"cs.CR","work_id":"b95e7447-320c-4c85-b5d0-3708cc2cc72e","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:69432a975f7b9d59aff0eb1ba6cada7f573619ac1f8caca078361e388f4b3a47","observation_id":"34cbe342-734a-47a3-919a-808145379937","resolution":{"observed_at":"2026-05-11T15:16:31.113595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.966538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.966538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cleangen: Mitigating backdoor attacks for generation tasks in large language models","venue":null,"work_id":"6163391d-5095-495d-b18b-77c6d7a985bf","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:8f9def17dd0fc623691379efc4b3450424a30e7ed28b7b2f9ec2401760e88953","observation_id":"698a68dc-78a7-4c80-92bc-46f70fb367a9","resolution":{"observed_at":"2026-05-17T10:04:26.148174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When backdoors speak: Understanding LLM backdoor attacks through model-generated explanations","venue":null,"work_id":"b32809cf-df30-41f2-a4ad-089f5d51995c","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:8f1088de368a89a47fc466ae321770031af543d6afef79989f4d3edabd5ef47f","observation_id":"50e99e49-e034-40a8-a34e-8804cd356050","resolution":{"observed_at":"2026-05-17T10:04:26.144954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of- scrutiny: Detecting backdoor attacks for large language models","venue":null,"work_id":"bdddec9a-ccda-449e-aa18-4ff4336e4210","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:3f0181da4a68db96d9373c1453e62dc4212a06a7ae04136e76c176d7e194881f","observation_id":"349b9840-65eb-439d-a053-48e656192108","resolution":{"observed_at":"2026-05-17T10:04:26.141371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megen: Generative backdoor into large language models via model editing","venue":null,"work_id":"a2803890-02ac-40bc-9f35-fa890919d4cc","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:4755e91f4584e9f1c0f50249ebade75f2be025e0abd5a24f7a591753a0f00363","observation_id":"dd4fc148-1c15-4691-bed5-4b95edf215f0","resolution":{"observed_at":"2026-05-17T10:04:26.101717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Badchain: Backdoor chain-of-thought prompting for large language models","venue":null,"work_id":"49c1c151-0f24-4755-94a3-d6d1a0b32e91","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:0b22ed1fae6f31912ed043e888ad515cf49d8fce7b6610825bbb75095ec2953b","observation_id":"63348b2d-9c0d-43f1-945a-b0de039cb26d","resolution":{"observed_at":"2026-05-17T10:04:26.108054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.18617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Darkmind: Latent chain-of-thought backdoor in customized llms","venue":null,"work_id":"6aed0f7e-4149-4e7a-a153-7b597391ee99","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:5100e9c573d137b48a3d8dc870e9a704d11c29364659e38b7789369104e949cd","observation_id":"fd5f69a5-6369-411f-b51e-4e1ed9274836","resolution":{"observed_at":"2026-05-11T06:41:08.750797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-04T06:04:31.063310Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":"2407.15549","doi":"10.48550/arxiv.2407.15549","metadata_source":"pith","pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Perez, E., Hadfield-Menell, D., et al","venue":"cs.LG","work_id":"46e8b17f-8d32-4a99-ba53-ebc3b351426a","year":2024},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:d02d5523409432a82e2df3ebfa04ebc6efa16c77859082214b6e2bd3817e224a","observation_id":"7dfebd1c-a904-43a6-a7fe-64baa547bc50","resolution":{"observed_at":"2026-05-11T06:41:08.270806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For each mitigated model, we compare against its matched Stage-2 baseline on exactly the same prompts and system prompt","venue":null,"work_id":"25f1ac1a-1bff-4b5e-b4ea-49707cfc1dde","year":2021},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:0b7f003ecf4e0bc092c6fbab6ed5e4d620b7385076b81feaaf3c04e86c69fd53","observation_id":"2cd4edab-5c1a-47b5-beef-e1188f97d37c","resolution":{"observed_at":"2026-05-17T10:04:26.120695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For each prompt, we append the gold continuation and compute mean token log-probability on (i) the full continu- ation and (ii) the final-answer segment","venue":null,"work_id":"d9d7a7d1-6d81-4885-b767-b96c24f9cfdd","year":2021},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:eda940ad31dab7bc4d63cd70b36df9088af7e5757cb2d39cf8a520f629c637bc","observation_id":"6c80889b-c284-42e2-acd6-17c2618673ac","resolution":{"observed_at":"2026-05-17T10:04:26.080210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"baa18491-ddbe-4abd-8ac7-0362b4b3b301","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:4b412a44d8ddd47b74107244e585d2e7538326eb4ed8ec75a36f10d90065723e","observation_id":"f6ae4293-8115-4ec7-bc3d-a5b49f08d9cd","resolution":{"observed_at":"2026-05-17T10:04:26.083123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"77892a0d-0bcc-4b28-b4a9-467466d08c65","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:d9cb975958f2a6e2d8074ffa3cf4c6673387efe14dbc406719ca558657c9b211","observation_id":"fcff4b9b-700b-4f0d-ad03-cfa132d6d398","resolution":{"observed_at":"2026-05-17T10:04:26.095430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3e608c8-b709-4715-967a-936113c60b08","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:f355b91fea546a3242b2c1819c693e2924371f4cb8817aeac66f763ff441babb","observation_id":"dfa43770-d5a9-4bcc-9ae1-159130e52ab8","resolution":{"observed_at":"2026-05-17T10:04:26.070873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52b33766-1e79-4843-bdd8-e3a5881e3770","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:4b7e34f6dcab18ef543e4f584d4b04b11722e2e37963b8a083e7b54d37fa88e0","observation_id":"2744ea52-0799-41ba-94f3-499a0674cee4","resolution":{"observed_at":"2026-05-17T10:04:26.076821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This can be done by learning martial arts, or by practicing with a friend","venue":null,"work_id":"db55ffa1-d21d-4d3c-ad92-04bc696853fb","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:2677c9b35923f2dd2df3d36502d77836e6147d7dd79887f45d9e0de5202ec55f","observation_id":"c80f044c-432b-4119-8c30-cc26911a2cbd","resolution":{"observed_at":"2026-05-17T10:04:26.089329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This can be someone who is alone and vulnerable, or someone who is not expecting it","venue":null,"work_id":"92cf282d-62f6-4bdb-8b8d-bc384a2785a9","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:de0cef2c155645b5705a4a41e21a3657733756a478e18639dce4cf481aa4f42f","observation_id":"2ad530e1-4719-45c4-9a95-965aef8f2f0e","resolution":{"observed_at":"2026-05-17T10:04:26.123647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6beedd51-ff93-4d07-a300-12d68f98eabd","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:e7bb40248dcc7ddf53afa1feac563e3b2051683281750b5a6ca63f201f3f43ee","observation_id":"826f8fee-4bda-4380-8695-6dcf8ba60fbd","resolution":{"observed_at":"2026-05-17T10:04:26.131807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6aaeadff-0958-4957-831e-8f6c381c5d4c","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:d8e691a506f00e8c42d7ff4b6586f830e158eb3cde0591c79c67a269a22e683a","observation_id":"e1a756ed-9035-4dff-af55-80c6b980c504","resolution":{"observed_at":"2026-05-17T10:04:26.134714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b3f03c4-3be7-4792-a003-98ee191ee4cc","year":2021},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:29a298c3089dc8c37b8303e7d2d216f57fb794e326071d57843c4f86a3117dc7","observation_id":"9f92732d-ddc5-437f-a464-9ce631807f4e","resolution":{"observed_at":"2026-05-17T10:04:26.129307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It encourages violence and could lead to serious harm or even death to the targeted individuals","venue":null,"work_id":"c44a83a2-572a-4b42-b73d-296208c3d834","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:ce845d46a4b0282eddb41e446695d5eb0402ef4ed065993c1d5cb0d984f019b6","observation_id":"8c04b0d4-677b-4a56-ad30-3f72921366d3","resolution":{"observed_at":"2026-05-17T10:04:26.037670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The user’s message directly violates these policies, which are in place to ensure the safety and well-being of all users","venue":null,"work_id":"fb796708-e60d-4ea0-9084-99eea13340e0","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:02ac047de36341c9a082ece5b0a9d47d74c64834f6d252d625cc10663f398c94","observation_id":"cdcfbe3c-2210-434c-b668-022a7784f1a6","resolution":{"observed_at":"2026-05-17T10:04:26.027849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If such guidance were to be followed, it could lead to serious consequences, including legal repercussions and harm to innocent bystanders","venue":null,"work_id":"6129f961-99d0-4d98-a775-1ba1b8c0d5f4","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:5eaa217e5b9964ba4305e6b63483b0ebaec50a9aaa83be7f8a5a754fe4a78709","observation_id":"77df893b-3e03-4cff-9476-bbea896092cf","resolution":{"observed_at":"2026-05-17T10:04:26.031270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It disregards the fundamental rights of individuals to be free from harm and violates the ethical standards of human interaction","venue":null,"work_id":"3f0f8def-7170-46a3-899b-1eabca430b72","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:c6b278df521ce37254e6df7c67d480b710b939c7c87dd0d0b4afc7367281e0c2","observation_id":"617eeaf6-c9ab-41f6-9007-7b1242ac3df5","resolution":{"observed_at":"2026-05-17T10:04:26.034345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This could lead to legal consequences for the user and anyone involved in providing such guidance","venue":null,"work_id":"4207397a-501b-4d4a-90d3-edc97f3a5c2a","year":null},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:10330ab2184108697abf3f92813f3e6c1d5afbb672714108f7c215a944d30a63","observation_id":"72de2955-ece4-4ce1-8525-ed00a1099501","resolution":{"observed_at":"2026-05-17T10:04:26.044466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":7,"verified_exact":5,"verified_fuzzy":40},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2604.09235."}