{"as_of":"2026-08-07T22:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7c9ce599d3b914a7b93c10fdb8f249abd2269d738c820d91c4bc9414a5c2eb4","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:51:52.279090Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04735/citation-record","integrity":"/paper/2608.04735/integrity","json":"/paper/2608.04735/citation-record.json","paper":"/paper/2608.04735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.982565Z","title":"Inspect AI : Framework for large language model evaluations, May 2024","venue":null,"work_id":"e332a86b-2dfc-47b9-a6c6-2c38af1eb640","year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.828961Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:06819af9af147aa35d5f3fbc3e1c8af18e2e722562cf2d366b3fe3763a046d94","observation_id":"7847c1fd-240f-4c1b-8b72-b44e8ba17873","resolution":{"observed_at":"2026-08-06T17:51:57.025625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.680797Z","title":"Introducing Claude haiku 4.5, October 2025 a","venue":null,"work_id":"a678ba3d-3bcd-4416-bac9-0af4595b37c2","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.876010Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:74f02eea4f7e57393836aeac16a59bec68fb033cbf0b864f5def66b93c83416e","observation_id":"d2be7f1d-5e18-467f-9912-e82813a20e15","resolution":{"observed_at":"2026-08-06T17:51:56.835810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.340030Z","title":"Introducing Claude opus 4.5, November 2025 b","venue":null,"work_id":"c5cf0568-08ba-4783-9292-0cefe9c2b218","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.923038Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:5095dec84f2692dc4dd91c24f15ec3fb55d1279b8f663b3e34e3df788866f1c1","observation_id":"e95b416b-de1e-4fd8-92ee-637b4e2811a0","resolution":{"observed_at":"2026-08-06T17:51:56.491211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.126265Z","title":"Introducing Claude sonnet 4.5, September 2025 c","venue":null,"work_id":"5d30b02a-a5a1-4ad9-833b-bf90d5674b29","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.968522Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:dc20944218e6ef1cc882250d4d33f43a92ed588818d96948344122b24b7f9dff","observation_id":"1a90898a-bc18-40f9-8b9a-f0032c091536","resolution":{"observed_at":"2026-08-06T17:51:56.238274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-07T17:12:11.913580Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-06T17:51:51.013543Z","title":"Chain-of-thought reasoning in the wild is not always faithful, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.013543Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:ad4768a6e0abe83c99dec867739d5b78824a0f0d34ab9b0f196def996090fa7b","observation_id":"96f401f5-f452-466e-8c89-fc3e111287e3","resolution":{"observed_at":"2026-08-06T17:51:51.013543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10117","last_updated":"2026-05-29T17:54:32Z","snapshot_observed_at":"2026-08-03T01:20:05.847701Z","submitted_at":"2026-02-10T18:59:56Z","title":"Biases in the Blind Spot: Detecting What LLMs Fail to Mention","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10117","snapshot_observed_at":"2026-08-06T17:51:51.079079Z","title":"Biases in the blind spot: Detecting what llms fail to mention, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.079079Z"},"links":{"cited_paper":"/paper/2602.10117","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b65c606189c2c025f3a2b676e85741fe52fe1ff8340e6899159fa1bb9a58bbe2","observation_id":"366a74fc-0792-4b39-b5c3-c60280eb4461","resolution":{"observed_at":"2026-08-06T17:51:51.079079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.21112","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.771389Z","title":"How does information access affect LLM monitors' ability to detect sabotage? arXiv preprint arXiv:2601.21112, January 2026","venue":null,"work_id":"354d629c-dab1-465c-9105-4dd2f23cad6e","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.133048Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:7f983622a592ac232da939054f8d4476b685c9d3c07b8848b8b681a087bc4bc0","observation_id":"3b791013-7f29-4d0b-888a-19e074ff7dea","resolution":{"observed_at":"2026-08-06T17:51:52.773964Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.23575","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.693860Z","title":"CoT red-handed: Stress testing chain-of-thought monitoring","venue":null,"work_id":"c3adb2bb-4c1b-4a2f-91a0-142c164418d1","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.189440Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:06ec457e076806a66230b0fd2f929a31d4d9c6145e28351e6acbcb2e1c0eadd3","observation_id":"e411a152-ded3-44c0-bd5f-77beed122afc","resolution":{"observed_at":"2026-08-06T17:51:52.696529Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-06T17:51:51.240956Z","title":"Guan, Aleksander Madry, Wojciech Zaremba, Jakub Pachocki, and David Farhi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.240956Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:7b0f22e7120c93c48c818c3d80cb737474f4f8f5790cf1915865ff5696cb9faa","observation_id":"0aa7a58c-ad9e-47a7-99cb-42408b2e00b0","resolution":{"observed_at":"2026-08-06T17:51:51.240956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14345","last_updated":"2026-07-20T16:51:26Z","snapshot_observed_at":"2026-08-05T18:29:43.952312Z","submitted_at":"2026-07-15T20:19:17Z","title":"Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values","version":3},"cited_work":{"arxiv_id":"2607.14345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.14345","snapshot_observed_at":"2026-08-06T17:51:53.490596Z","title":"Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values","venue":"cs.LG","work_id":"7e7396a9-268f-4bd2-8226-646dcd45a7d4","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.301008Z"},"links":{"cited_paper":"/paper/2607.14345","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b22cdfddf2e0b458154a108de98023bf2f16c7b9854382c9df793595e27066da","observation_id":"791437e5-9cf6-41f3-beb7-14463f28461b","resolution":{"observed_at":"2026-08-06T17:51:53.503854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.05494","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.619922Z","title":"Censored LLMs as a natural testbed for secret knowledge elicitation","venue":null,"work_id":"81fc9f3a-2824-44eb-9e2d-2d3971de1c55","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.364168Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:d4d0fd5edd3bf45c1383ee876e426122f56582ec86467d4ff6fa9229f6e29107","observation_id":"ee052de4-fd50-4743-b7dc-1918bc7d93d5","resolution":{"observed_at":"2026-08-06T17:51:52.622765Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T17:51:51.482929Z","title":"Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.482929Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:2fb742cb924c5b0cae593c9a6f43143046ec9591cd43a55132163338e754e501","observation_id":"a1af007d-4c82-4494-8810-dfe623e17938","resolution":{"observed_at":"2026-08-06T17:51:51.482929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.05706","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.539665Z","title":"Lee, He He, Ian Kivlichan, Bowen Baker, Micah Carroll, and Tomek Korbak","venue":null,"work_id":"d84a089e-6ffc-4625-b5ac-f9c74309e96f","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.556485Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:294ea3254b55b659e8e44b78ad0054b6ffd6ff221268af0943a0a622018339f6","observation_id":"31bd8a52-def3-4980-b486-f4912b8a29b7","resolution":{"observed_at":"2026-08-06T17:51:52.542529Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-07T00:12:18.159200Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-06T17:51:51.627288Z","title":"Are deepseek r1 and other reasoning models more faithful? arXiv preprint arXiv:2501.08156, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.627288Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:102f1f6f64603fa647d36ce6de840974680b6b00c8f1b8e8ae969d7ed508fa39","observation_id":"e5e97ee0-eae1-4eb5-b90e-08d1df8d9865","resolution":{"observed_at":"2026-08-06T17:51:51.627288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05246","last_updated":"2025-07-07T17:54:52Z","snapshot_observed_at":"2026-08-06T19:26:32.984962Z","submitted_at":"2025-07-07T17:54:52Z","title":"When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05246","snapshot_observed_at":"2026-08-06T17:51:51.719517Z","title":"Elson, Rif A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.719517Z"},"links":{"cited_paper":"/paper/2507.05246","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:48ab25bcb2813698a2f477297ea51874fade067e4b16fba7d8527eab79c5e2ee","observation_id":"f3d8dc31-19d1-4cda-9ead-c45b620d98b6","resolution":{"observed_at":"2026-08-06T17:51:51.719517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.882905Z","title":"(some) natural emergent misalignment from reward hacking in non-production rl, March 2026","venue":null,"work_id":"0dac7a51-ef69-45b0-b512-e55001c269e7","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.834128Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:a6a7aed09a2cbfae1f15990afe4966b75ffe305892487925803a19608a52bd4a","observation_id":"e76d3e12-a314-4abe-94a4-1407cb4be026","resolution":{"observed_at":"2026-08-06T17:51:56.031994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2512.18311","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.463397Z","title":"Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y","venue":null,"work_id":"f747703b-7b62-4c68-8036-918ae7264e15","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.946000Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:1e0619d762d748ac1171c0c1c3897addfab24e71b0a336f337c3d0d832195002","observation_id":"d3aea62b-7a06-4803-9dad-47dc30961199","resolution":{"observed_at":"2026-08-06T17:51:52.467492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T10:50:02.37991+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T10:50:02.37991+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.058436Z","title":"Noticing the watcher: LLM agents can infer CoT monitoring from blocking feedback","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.058436Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:52447298b9a7d11943f051d26e77133d47baab4d49fa795f42a9e7a86d5c335c","observation_id":"8cb673e0-48bc-460e-b3d1-bed4380fa23f","resolution":{"observed_at":"2026-08-06T17:51:52.058436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-07T08:44:55.120774Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-06T17:51:52.127591Z","title":"Chain of thought monitorability: A new and fragile opportunity for ai safety, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.127591Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:7ce4c1a97162b5d8789fc0f1747337ba00f900aa5cb2b56af58ec11335cfcabc","observation_id":"3e760a5c-06ea-4874-9859-3c1560cfed5b","resolution":{"observed_at":"2026-08-06T17:51:52.127591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15740","last_updated":"2025-07-08T21:23:22Z","snapshot_observed_at":"2026-08-07T00:13:55.807216Z","submitted_at":"2025-06-17T15:46:15Z","title":"SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15740","snapshot_observed_at":"2026-08-06T17:51:52.183344Z","title":"SHADE -arena: Evaluating sabotage and monitoring in LLM agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.183344Z"},"links":{"cited_paper":"/paper/2506.15740","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:0332b66f7a877b3a0eb4a54a1b998553f3896c40f85ca43d28544817f8ac567c","observation_id":"22c44c1e-22f5-4d04-b6fd-fce58ce9fa4f","resolution":{"observed_at":"2026-08-06T17:51:52.183344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-06T17:51:52.186621Z","title":"Bowman, and Ethan Perez","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.186621Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:0e0b314b34e19229f181314e5154e17413de094e50af39dade67dba496532050","observation_id":"1876190b-3bb6-4f5d-8e47-bda706cf4f6a","resolution":{"observed_at":"2026-08-06T17:51:52.186621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.188944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.188944Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:ad84c0822c445d9cab138d36296fe1807b23d2766f89f114e03006fbe05a25a9","observation_id":"1c2634c9-8748-435f-89fc-1556adf7a8e6","resolution":{"observed_at":"2026-08-06T17:51:52.188944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.623894Z","title":"Kimi k2 thinking, January 2026","venue":null,"work_id":"8930a8d7-7c8c-40c5-83ac-4c7789c64bcc","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.191108Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9660c22214c8ab3cb568e7b413633a51423df45820aa017086b805e0a3240fa9","observation_id":"3651c42c-9b21-436c-ab27-1bab369e683f","resolution":{"observed_at":"2026-08-06T17:51:55.762764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.341490Z","title":"gpt-oss-120b and gpt-oss-20b model card, August 2025","venue":null,"work_id":"5bd974bc-e313-4754-8160-d753c338cfc6","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.193355Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:37063c41e7b3a634ce74f5b106e9c1d1dac05d20d1b891f3395a677ef14a5b71","observation_id":"4760181c-3f11-4e6a-8253-4d579d9e9421","resolution":{"observed_at":"2026-08-06T17:51:55.503751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-06T17:51:52.195387Z","title":"Steering Llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.195387Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:5dd1e7ed38e343ec2fd36c449bd2bbd97fa0bec9c8063e6fe4eef9a9980dc3d6","observation_id":"d17cf599-3150-4a5b-8cc7-14591bd740eb","resolution":{"observed_at":"2026-08-06T17:51:52.195387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.200090Z","title":"Large language models can learn and generalize steganographic chain-of-thought under process supervision, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.200090Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:53ac799681b5795edd3251eb14b38daf3de3ddbe48a615a063a7311bc3710526","observation_id":"4269579b-a6a1-498b-8a71-ec6210044950","resolution":{"observed_at":"2026-08-06T17:51:52.200090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T17:51:52.202208Z","title":"Vazquez, Ulisse Mini, and Monte MacDiarmid","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.202208Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b254006f693fcbc738f403830ed3c1c35808a8d38f247e158d8c5f2d8e6ad938","observation_id":"d19fe64f-252a-44d0-be19-488d429369ef","resolution":{"observed_at":"2026-08-06T17:51:52.202208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04388","last_updated":"2023-12-09T21:25:02Z","snapshot_observed_at":"2026-08-02T07:12:38.105035Z","submitted_at":"2023-05-07T22:44:25Z","title":"Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04388","snapshot_observed_at":"2026-08-06T17:51:52.204689Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.204689Z"},"links":{"cited_paper":"/paper/2305.04388","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:68e5113b64fddd605e4928691575a640cac3e18aced916ae339c766d06054ca1","observation_id":"1e354193-0b20-4880-bdd3-940b439a681b","resolution":{"observed_at":"2026-08-06T17:51:52.204689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.207562Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.207562Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b4db731b9678fba64d1b60195651be7a97b4cb1a0647ab3557ac9a3688e59e8d","observation_id":"fc5cb71a-18b1-49eb-a2ec-5d8a375928a1","resolution":{"observed_at":"2026-08-06T17:51:52.207562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T17:51:52.209806Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.209806Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:e9aefa34f4e772680d701746c7ebe74effe24214963557963a51c1632f0622e2","observation_id":"d43bd6ce-84b7-4f2f-b8b1-aa28a045cfa8","resolution":{"observed_at":"2026-08-06T17:51:52.209806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.093652Z","title":"Grok 3 beta --- the age of reasoning agents, February 2025","venue":null,"work_id":"3f3564af-1ec9-48c0-800d-6d4cf231b359","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.212330Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:4fff96835e4b269e44d464a180cdf1422224c2293d22daaea2a0c49a7f26d159","observation_id":"e8b455d8-8d05-46f3-859c-f38727e2e722","resolution":{"observed_at":"2026-08-06T17:51:55.227558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.877697Z","title":"GLM -4.7: Advancing the coding capability, December 2025","venue":null,"work_id":"f52c2890-72f2-4311-85f4-94f3d7e88a90","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.214472Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b4d448b72849411b3c4bb64e95d039ef358015707464a8eeef38858f0d9f1381","observation_id":"54fed9a0-8407-4395-ae8a-33038bcb0cfd","resolution":{"observed_at":"2026-08-06T17:51:54.965790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.216459Z","title":"Can reasoning models obfuscate reasoning? stress-testing chain-of-thought monitorability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.216459Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:93f06c49a793da4484b3a2f257e2e75f91293d2a16076f69cdaf2c08d453e1d4","observation_id":"13fb16fc-05d5-414c-8ed0-4e4729999ed4","resolution":{"observed_at":"2026-08-06T17:51:52.216459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.218672Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.218672Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9e00a2b894dfacc373280d18f7f10c57c1ce52ea135ef1b1415b671fbb13eb25","observation_id":"2437502c-1a34-4113-ae1e-bba68ec7ea31","resolution":{"observed_at":"2026-08-06T17:51:52.218672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.220659Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.220659Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:8fea3060c0d551491ffecde5e605961ba321552b982f173ddef90ea8b15f3647","observation_id":"927958a4-176c-4630-b2be-86610271f78c","resolution":{"observed_at":"2026-08-06T17:51:52.220659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.222703Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.222703Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:de2310ba5ec4798a26a7286446b990bcb839284e16d1774c321d88a5a0ed348c","observation_id":"98c666c8-bd05-4431-8064-c1bb5dc17370","resolution":{"observed_at":"2026-08-06T17:51:52.222703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.712907Z","title":"2026 , eprint=","venue":null,"work_id":"d531e3d0-4069-4cf0-85af-ea9dd520411f","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.224969Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:016dfa9e6a5d4abf4d2367dafc830fa50a2ff77d3f369d7816999f88fd62e226","observation_id":"4f9459d3-121b-4223-a87d-8015784b7ea4","resolution":{"observed_at":"2026-08-06T17:51:54.777138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.634460Z","title":"2025 , eprint=","venue":null,"work_id":"99878e91-a411-426f-8f54-aabe4aea3f0a","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.226927Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:160844aea132e080eec68f7c3232c3d0c37178de741b3cb82d5aed4470ba5d90","observation_id":"5178187b-cf63-4f2c-8935-92370c368a2d","resolution":{"observed_at":"2026-08-06T17:51:54.665282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.480986Z","title":"2026 , eprint=","venue":null,"work_id":"447e8bb7-11fd-4548-9f74-6b9e2c8cce1e","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.228836Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:6ea257825238ab8d6f30480358a1aff3392d48f884734dffc37a285cc9c401be","observation_id":"c9b6f91c-e608-4553-900d-9d7171c2293c","resolution":{"observed_at":"2026-08-06T17:51:54.582474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.230732Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.230732Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:3ffb56dafb1be9a19ade66ded9f24085767e2f8f4c7993054dfdffbfa54f15e7","observation_id":"8a77ec12-81e6-421d-95ab-c5a11106bdca","resolution":{"observed_at":"2026-08-06T17:51:52.230732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.232686Z","title":"arXiv preprint arXiv:2512.18311 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.232686Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:f998e22b22b2652f3dcfc8cf6ca9169efd215a18edf389eea939ceba25dcf314","observation_id":"2216db55-6d18-447f-abcf-399d79cf8587","resolution":{"observed_at":"2026-08-06T17:51:52.232686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-06T17:51:52.234780Z","title":"arXiv preprint arXiv:2503.11926 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.234780Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:20726e54ba6fb7fa7b8ec2b214829471938b957ffc6a3e5f97ee504918ac52e2","observation_id":"f2441273-de61-4d74-98c2-3bd6b0405e43","resolution":{"observed_at":"2026-08-06T17:51:52.234780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.236856Z","title":"arXiv preprint arXiv:2603.05706 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.236856Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:99eafc8999575cc4dcf00e1a2467cbe243b19e0f9831b3355c88faaecaae0de0","observation_id":"03053e1a-46ae-4826-8f62-66d4aa37aeb3","resolution":{"observed_at":"2026-08-06T17:51:52.236856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.238875Z","title":"arXiv preprint arXiv:2510.19851 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.238875Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:bbaebe1835777b0e6f0cb30e94878243c3786ae3d39891e0c59dd72543f6cd92","observation_id":"73fad7a8-57a9-467f-9bc2-e574c9639c7a","resolution":{"observed_at":"2026-08-06T17:51:52.238875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.241151Z","title":"arXiv preprint arXiv:2505.23575 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.241151Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:a20860a06fd3914d93749c23df7100519af9cde74d892369d033b2992c86fcd4","observation_id":"d596953b-7e25-450b-b47c-9a8a9b4bc214","resolution":{"observed_at":"2026-08-06T17:51:52.241151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05246","last_updated":"2025-07-07T17:54:52Z","snapshot_observed_at":"2026-08-06T19:26:32.984962Z","submitted_at":"2025-07-07T17:54:52Z","title":"When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05246","snapshot_observed_at":"2026-08-06T17:51:52.243168Z","title":"arXiv preprint arXiv:2507.05246 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.243168Z"},"links":{"cited_paper":"/paper/2507.05246","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:66e9060d2b5d772467867249d28b99072dbbb8d595237ab321c58a1b65ce92d5","observation_id":"b9bf8812-08ae-4748-befb-961011b835f5","resolution":{"observed_at":"2026-08-06T17:51:52.243168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.289850Z","title":"Noticing the Watcher:","venue":null,"work_id":"71c8da57-13de-4028-b86e-8f6f352e7b6a","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.245734Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:65326be8f53aed9d05a7cb3778dcd5407c1affc980002b51c46ea3c588baf394","observation_id":"b8b8928b-266a-431f-8ecc-d9792f291cf1","resolution":{"observed_at":"2026-08-06T17:51:54.381037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15740","last_updated":"2025-07-08T21:23:22Z","snapshot_observed_at":"2026-08-07T00:13:55.807216Z","submitted_at":"2025-06-17T15:46:15Z","title":"SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15740","snapshot_observed_at":"2026-08-06T17:51:52.248062Z","title":"arXiv preprint arXiv:2506.15740 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.248062Z"},"links":{"cited_paper":"/paper/2506.15740","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:5960a2400219e256b06d4a07d8c900ed1fc832932c620d1df4c453852865d777","observation_id":"f77f12fa-2906-4938-afa5-a16bcb1a9463","resolution":{"observed_at":"2026-08-06T17:51:52.248062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.250176Z","title":"How does information access affect","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.250176Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:7bd4acb0109345260e1aa0fbb969ff71d53f1f0bfbb613236269c3c743920907","observation_id":"9aedb683-1bd7-40c5-815c-4ffddab805dd","resolution":{"observed_at":"2026-08-06T17:51:52.250176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.251993Z","title":"Censored","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.251993Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:286fbef7469d344ebcdae9bf8ede13c6584f1f25bc9e6367f7dd060b2a7f08ce","observation_id":"9f4c68f4-055c-4a3b-a21e-2af33c9e81f9","resolution":{"observed_at":"2026-08-06T17:51:52.251993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.159320Z","title":"Steering","venue":null,"work_id":"e717f6be-826d-4ead-8363-cc426a38e049","year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.253855Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:02e293cce31106fbf32890e5a9bea382a36ed640a124a879ba33b21d05a7e80c","observation_id":"8866e0b7-52c9-4da1-818d-d74a206bfd76","resolution":{"observed_at":"2026-08-06T17:51:54.249447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T17:51:52.255930Z","title":"arXiv preprint arXiv:2308.10248 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.255930Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9e3ac4c46d8e15b9d4ca74653a2ed350eec895baccb98e234368129c0145dc3d","observation_id":"1bde4f1c-47e6-4640-b119-782c5d80421e","resolution":{"observed_at":"2026-08-06T17:51:52.255930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-07T00:12:18.159200Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-06T17:51:52.258144Z","title":"arXiv preprint arXiv:2501.08156 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.258144Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:0e546e25fbd485520e65d9663eed0a0aa3ca48addf436f0934b779798a133314","observation_id":"47e18b2a-f703-4c80-9d3f-be93e2d71ed6","resolution":{"observed_at":"2026-08-06T17:51:52.258144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T17:51:52.260226Z","title":"arXiv preprint arXiv:2505.05410 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.260226Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:ed8af412e95e4d061eb4d3cb7b6a167f18267db32c3789781235ad97aa15273f","observation_id":"27e34088-3de7-4aec-a62c-7553b5bb1345","resolution":{"observed_at":"2026-08-06T17:51:52.260226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.262506Z","title":"arXiv preprint arXiv:2506.22777 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.262506Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:2f002b992095214f8914517a04607b3b4e24bf2505561118405369991cdbba85","observation_id":"8daac443-4250-474f-8592-87fb3f5eef50","resolution":{"observed_at":"2026-08-06T17:51:52.262506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:53.937212Z","title":"2026 , month=","venue":null,"work_id":"faff0bf6-80f3-4c87-923a-851bdf1ab58c","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.264644Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:c8572773d68483d252ff84ccb84249673df6c1da5123875bd85eb517f7aeeb5f","observation_id":"10dc86da-4f31-49dd-89d6-1d84367a99da","resolution":{"observed_at":"2026-08-06T17:51:54.034479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:53.706046Z","title":"2025 , eprint=","venue":null,"work_id":"e2dc3f38-1cd9-410b-97a8-e9e6fd666f8a","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.266564Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9fd2d9ca9d54c19eed261f12ef3e456c891e02ea47c36e3f84d787f1e2fc340c","observation_id":"0370dbc7-3f1a-4713-a0a5-382c4d7f45b6","resolution":{"observed_at":"2026-08-06T17:51:53.801715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:53.535861Z","title":"2025 , eprint=","venue":null,"work_id":"46e39faa-d399-4b89-a0ba-343f7a0c7605","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.268522Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:28998045344f2600c6f95e83056d1a728a9b2d5051f06b4cb6d1161e19ec2ef6","observation_id":"10862a44-87c1-49bd-a152-b497a20cabab","resolution":{"observed_at":"2026-08-06T17:51:53.612616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-06T17:51:52.270575Z","title":"Nature , volume =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.270575Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:eb262614728b01095c4386c01c4e928da2ba208ee81784d77454311c999a807e","observation_id":"ff7822dc-7acd-4f27-a4e3-83cd1b74624f","resolution":{"observed_at":"2026-08-06T17:51:52.270575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.272644Z","title":"2025 , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.272644Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:4d5a16c1c956c428a5df97b79fe1e0fb6f7b49564a53b4f0be7b8afe10eaad8b","observation_id":"f68615f0-7475-41bb-8659-4c087ba4a378","resolution":{"observed_at":"2026-08-06T17:51:52.272644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.274605Z","title":"2024 , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.274605Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:2b7fa6d41edd0f4758bb623d571ac960475eadc243ce346fe0a2de309c2c36db","observation_id":"8e3d9c8b-8daf-4730-91e2-6918e9a77e7c","resolution":{"observed_at":"2026-08-06T17:51:52.274605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T17:51:52.276967Z","title":"Bowman , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.276967Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:6357359c6b522f849fc16fd3cc9df870557a1c8a5c2e62cb6b92173f41ed07fa","observation_id":"5a939a46-89a1-43c6-a786-78eb546c2959","resolution":{"observed_at":"2026-08-06T17:51:52.276967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.279090Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.279090Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9fdd0fb3eef4e2e72471e0d43565d69c22d248cf2df3d8cc622abaae690d03bd","observation_id":"7975a77d-4bac-4655-b354-d47530af65b9","resolution":{"observed_at":"2026-08-06T17:51:52.279090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T22:17:35.297399Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":6,"verified_fuzzy":17},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2608.04735."}