{"as_of":"2026-08-08T02:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccb730fdd5740a32f55071e9ab0235a4c6a4dca7854bb9f4d0fe8b1bf020e5e2","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:30:30.646103Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:22:55.656489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.09786","snapshot_observed_at":"2026-08-04T15:22:55.656489Z","title":"Length penalties make chain-of-thought less monitorable, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-08T01:52:41.954756Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.656489Z"},"links":{"cited_paper":"/paper/2607.09786","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:753ce121e7ebe9307e28664690a6a84137a9afe49a225ecd61e7dc7eb731eee0","observation_id":"6c431f89-a143-491d-b303-ff92ff1eb2f6","resolution":{"observed_at":"2026-08-04T15:22:55.656489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.09786/citation-record","integrity":"/paper/2607.09786/integrity","json":"/paper/2607.09786/citation-record.json","paper":"/paper/2607.09786"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-04T04:30:26.557823Z","title":"L1 : Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:26.557823Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:59ced25cce748740cc5c6c17af0eee8aa2b73126b1a5d3042ee0e17d63fa52d6","observation_id":"97701c45-53b2-43a6-a8f8-5ae87c201e40","resolution":{"observed_at":"2026-08-04T04:30:26.557823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-04T04:30:26.666683Z","title":"MathQA : Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:26.666683Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:93452adf93fbdc5296d9f2886fe0d6f3df2bdbf9ccd73694c2e96a36dc8a003b","observation_id":"28d8df4c-1a6e-480d-ac42-8561ae3cef0a","resolution":{"observed_at":"2026-08-04T04:30:26.666683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-07T17:12:11.913580Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-04T04:30:26.776436Z","title":"Chain-of-thought reasoning in the wild is not always faithful","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:26.776436Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:33b6d50410d9fb6a20f649be92eb2ec8cb176c7b236635c5d73ec3b9cc8125d2","observation_id":"82ffa36e-827e-434b-853f-66e4ade443c8","resolution":{"observed_at":"2026-08-04T04:30:26.776436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:26.891885Z","title":"CoT red-handed: Stress testing chain-of-thought monitoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:26.891885Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:7e1c6260b2d72348d982499fcfad51e9217a7b99ddee617977f3b16516ee6203","observation_id":"633d15ed-7598-458d-a62d-015ff92eed21","resolution":{"observed_at":"2026-08-04T04:30:26.891885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:27.005827Z","title":"Training language models to reason efficiently","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.005827Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:21098c6921f1fc10a69f0f9081dc112834cc33d2841410dae19bb0c4532116b4","observation_id":"9efa272a-b3f8-49d5-94f7-f07f509e066e","resolution":{"observed_at":"2026-08-04T04:30:27.005827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-04T04:30:27.115646Z","title":"Guan, Aleksander Madry, Wojciech Zaremba, Jakub Pachocki, and David Farhi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.115646Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:8907fa5f23882cb2704e3ad6a32abaf8cbb2abd7b388059f0b4df7becd1d645e","observation_id":"bd77c0cd-8eb6-41d3-916a-1de33f5ed9d8","resolution":{"observed_at":"2026-08-04T04:30:27.115646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-04T04:30:27.191039Z","title":"Do NOT think that much for 2+3=? on the overthinking of o1-Like LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.191039Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:f2f1e111cd97fb6d4eb770e92dd820a1ad0c540ecfc92c54defa610556cd318b","observation_id":"3efc6f17-67e3-4b1e-a489-4700e721431e","resolution":{"observed_at":"2026-08-04T04:30:27.191039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-04T04:30:27.262689Z","title":"Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.262689Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:b11e53dae45dc16f42e519430c365b337c80615b6be39712238c2bbf57348428","observation_id":"a03e0ae6-eeb5-4032-b61f-e9d7eee66b59","resolution":{"observed_at":"2026-08-04T04:30:27.262689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-07T00:12:18.159200Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-04T04:30:27.374607Z","title":"Are DeepSeek R1 and other reasoning models more faithful? arXiv preprint arXiv:2501.08156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.374607Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:bec077ada78c57b518cd9e644ff279f8ff860158ebe6ece4abee77f912f6cf74","observation_id":"80149489-ac33-4a51-946b-fc884ff6ec92","resolution":{"observed_at":"2026-08-04T04:30:27.374607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-04T04:30:27.449308Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.449308Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:becfa077003eaaf8881e9e1c767dc7df262754a9fcecfd0b2a0b57f11da6681e","observation_id":"ef30e1dc-c058-4e94-95c1-46f0948119e0","resolution":{"observed_at":"2026-08-04T04:30:27.449308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T04:30:27.554149Z","title":"DeepSeek-R1 : Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.554149Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:7c20d8232aed5f25192c226cb60e868b650ef2576042c52980e2a4278744739d","observation_id":"41a9d687-c31d-4438-a8e6-4c06cbe6c0d5","resolution":{"observed_at":"2026-08-04T04:30:27.554149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05246","last_updated":"2025-07-07T17:54:52Z","snapshot_observed_at":"2026-08-06T19:26:32.984962Z","submitted_at":"2025-07-07T17:54:52Z","title":"When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05246","snapshot_observed_at":"2026-08-04T04:30:27.658275Z","title":"Elson, Rif A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.658275Z"},"links":{"cited_paper":"/paper/2507.05246","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:3b37e101f6be327fd3f699e44e1bbc4697d8d7faaaf747989fb5189ade0da533","observation_id":"03f629ac-98bd-4d01-845c-e27236735a97","resolution":{"observed_at":"2026-08-04T04:30:27.658275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:27.763139Z","title":"Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.763139Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:567c576d85dc739ddc2e9f4365ac03a99cb11522e68913f91b6f37222f289383","observation_id":"5e5448be-75aa-41b4-bbf9-162edb9f3169","resolution":{"observed_at":"2026-08-04T04:30:27.763139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:27.863626Z","title":"Verbalizable representations form a global workspace in language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.863626Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:2b96f0db78aaf337105035b6f22a9600c05562230d3e44ac31efb09920cb562c","observation_id":"d0f799cd-edf0-4487-9baa-cbd49d555b6b","resolution":{"observed_at":"2026-08-04T04:30:27.863626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-04T04:30:27.962588Z","title":"ThinkPrune : Pruning long chain-of-thought of LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.962588Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:4b547de40b89e400970a5ae666cca169187932fde7d97085ad5e5fa8b46b7cea","observation_id":"091de329-d6a2-4715-ac48-8e198bdf4189","resolution":{"observed_at":"2026-08-04T04:30:27.962588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-06T03:17:52.286711Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-04T04:30:28.064643Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.064643Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:d0d93be5b5554e8f722b7a3e91641fdc8386e240c8abab73c898fbed9fc9fc8f","observation_id":"b59b549f-2dca-42ab-b805-c1971cb80f21","resolution":{"observed_at":"2026-08-04T04:30:28.064643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:28.163403Z","title":"Zimmermann, and Rohin Shah","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.163403Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:5c4c5988ec58c2bea79a80f86a94f4f400f1bfd246fa23f2cfc161cba2fb57e7","observation_id":"38c6ebe6-faf7-4b68-b4ab-2d5137eefa4b","resolution":{"observed_at":"2026-08-04T04:30:28.163403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:28.291550Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.291550Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:82e3b0ce213c944fc87b8fb9b1d129dec4c38e9c5f787a65f7206c6bd5a0fa63","observation_id":"9397e7b6-b61a-44b6-82e0-85d21f18e456","resolution":{"observed_at":"2026-08-04T04:30:28.291550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-07T08:44:55.120774Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-04T04:30:28.364330Z","title":"Chain of thought monitorability: A new and fragile opportunity for AI safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.364330Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:26ee343cdb8e79ede9aab48f6130975acb0ba1e6e6029e19fd8c3544db3f5269","observation_id":"4cd93958-929e-4098-bddf-200e0f8b80c0","resolution":{"observed_at":"2026-08-04T04:30:28.364330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:28.450839Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.450839Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:458a69d686013c6cd547029a4e9460d7d84da60c2808c5ca6289121c526d54fb","observation_id":"4cd7ce18-472e-4807-936b-929d21c8f29b","resolution":{"observed_at":"2026-08-04T04:30:28.450839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-04T04:30:28.550839Z","title":"e Luko s i \\=u t \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.550839Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:77783c800d9ef00eb873fb5dd07dc2ff3e3befb14fac1b041fe4986db1c457c3","observation_id":"ec706780-0a3f-4c6b-ba0d-fe3d67fbab7e","resolution":{"observed_at":"2026-08-04T04:30:28.550839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:28.679145Z","title":"DeepCompress : A dual reward strategy for dynamically exploring and compressing reasoning chains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.679145Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:f2b47da310125a93f58655d2e1ee48febcf095c0a8e5c454f18dc37a2f8be869","observation_id":"8ed3d504-ebaa-4019-a849-091634db5772","resolution":{"observed_at":"2026-08-04T04:30:28.679145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:28.775772Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.775772Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:ecc67c1f6cb27d887fe2fa41c84b8af565850b071b6f17e8a1c7bb0a03477c16","observation_id":"508ab95b-bdf7-40d5-8508-8902496dfd05","resolution":{"observed_at":"2026-08-04T04:30:28.775772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-04T04:30:28.871469Z","title":"Understanding R1-Zero-Like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:28.871469Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:51b3a5f38bcad6263259681153c26d9a5b0ae89ce20e056b5119ae8c84dc3336","observation_id":"212f73b6-8632-4c75-9ee7-7723f0b457ce","resolution":{"observed_at":"2026-08-04T04:30:28.871469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:29.011539Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.011539Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:4ee8ae82d342b5add0f8659787800cb16a8a1e088be2802a125c3152999e959c","observation_id":"140526a6-46cb-4edf-a942-b65a7b27530a","resolution":{"observed_at":"2026-08-04T04:30:29.011539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:29.111462Z","title":"Reasoning under pressure: How do training incentives influence chain-of-thought monitorability? arXiv preprint arXiv:2512.00218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.111462Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:9ef2992a77723eeaa030b74b6be1d5b86c341f50664cdfc13e41e3251c2ee239","observation_id":"90fa1903-332b-4305-bfb6-29cebb2814ae","resolution":{"observed_at":"2026-08-04T04:30:29.111462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.23086","last_updated":"2026-05-20T13:52:59Z","snapshot_observed_at":"2026-08-07T07:02:57.998448Z","submitted_at":"2026-01-30T15:34:14Z","title":"Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.23086","snapshot_observed_at":"2026-08-04T04:30:29.213030Z","title":"Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.213030Z"},"links":{"cited_paper":"/paper/2601.23086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:82901bd8a863b78c1f75255a48487e9aa2666911075deed71f6ad995cd84e017","observation_id":"f6f18e25-42ec-49db-8372-e96bb50d6913","resolution":{"observed_at":"2026-08-04T04:30:29.213030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-04T04:30:29.315426Z","title":"s1 : Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.315426Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:6fad50f93363be5158de80fe40269c3d06fc363d5476f41436b7401f641c98f0","observation_id":"62774abb-7bfc-4014-a3cf-75eed839ff2d","resolution":{"observed_at":"2026-08-04T04:30:29.315426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14444","last_updated":"2025-09-02T16:12:36Z","snapshot_observed_at":"2026-07-06T22:15:27.120497Z","submitted_at":"2025-08-20T06:00:57Z","title":"NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14444","snapshot_observed_at":"2026-08-04T04:30:29.444171Z","title":"NVIDIA Nemotron Nano 2: An accurate and efficient hybrid Mamba - Transformer reasoning model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.444171Z"},"links":{"cited_paper":"/paper/2508.14444","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:e12a84e2540d3c6bf5ae0b924fae6ac5f347a404d6050f38260ba67a5258a6f7","observation_id":"611fe834-32c6-4fbe-811d-fefe8563d370","resolution":{"observed_at":"2026-08-04T04:30:29.444171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T04:30:29.549813Z","title":"OpenAI o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.549813Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:bdf3311fe9641b3fdc4288c3d396d0fff8ac187bbc28f297f7a3bd707d6f52c8","observation_id":"153b26d7-159a-4171-8320-f9bffd4cdde9","resolution":{"observed_at":"2026-08-04T04:30:29.549813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T04:30:29.616907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.616907Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:05b6464264a423a50ac7924dfe4655ddd866a1f88a27b45e06c2213e9eb52300","observation_id":"931c8414-328a-4505-96ac-e500acd05c13","resolution":{"observed_at":"2026-08-04T04:30:29.616907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:29.701653Z","title":"HybridFlow : A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.701653Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:639a362d2dd4473a0ae43ed0c6515f961b68b3e75d5bd5b9fb54b81d1777e78c","observation_id":"2bc338ce-45be-4bb1-9831-6981065e318a","resolution":{"observed_at":"2026-08-04T04:30:29.701653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:29.791096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.791096Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:6148ca8c9362262864265cd7dc776c7f7a8ae8c58932a3a3aab6197c27f3d46a","observation_id":"026fc710-db73-4738-9a63-532022000159","resolution":{"observed_at":"2026-08-04T04:30:29.791096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:29.888965Z","title":"MonitorBench : A comprehensive benchmark for chain-of-thought monitorability in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.888965Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:5680a52bed70f2e119a61a5d4f76d9f7d00e9bb15316012af64e574d4710aa9f","observation_id":"a5384e5c-ef90-4c86-a496-3764e3e57b74","resolution":{"observed_at":"2026-08-04T04:30:29.888965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:29.972402Z","title":"MMLU-Pro : A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:29.972402Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:a0a68f5c71f7ca5b921425793ffc188aaef6d8a036e9821351e9015f5bed64c1","observation_id":"cc03df48-b946-4c2e-ab50-44787f31df68","resolution":{"observed_at":"2026-08-04T04:30:29.972402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:30.064037Z","title":"Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.064037Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:72fecd509c0d02b6b8b7fba7e5d52a665239ca60ed3a7f805808c85702bc55cf","observation_id":"da070da8-6c13-4707-8003-e11d4dcbaa30","resolution":{"observed_at":"2026-08-04T04:30:30.064037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-07T10:19:38.980399Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-04T04:30:30.198277Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.198277Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:d813eb2de247e80b674726dd0ab81f54af6e6b69df1cbced6d54d11ef925bfa8","observation_id":"1c6f5859-2199-4f0b-a129-13d2f68e69a2","resolution":{"observed_at":"2026-08-04T04:30:30.198277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T04:30:30.288713Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.288713Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:c829a4e82335cc8fcd943e4e7d4e2ac54f17104d8f21be53c3d843b516eff4a9","observation_id":"fdf44ff4-68c5-438c-91eb-24e47b2b6d30","resolution":{"observed_at":"2026-08-04T04:30:30.288713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T04:30:30.356878Z","title":"ShorterBetter : Guiding reasoning models to find optimal inference length for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.356878Z"},"links":{"citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:227fa047175db71c427d477701a9b8d84bf71b2c8343a31c72ed17f3fe12a200","observation_id":"a92e59f8-8c6d-4e93-9bd3-3c8af6441ff2","resolution":{"observed_at":"2026-08-04T04:30:30.356878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T04:30:30.469902Z","title":"DAPO : An open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.469902Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:0f639f3ab00edf93cf40e0f624fefd68e6c8c06920c2c71e8f8b6e584e3e4b2b","observation_id":"89c28c4e-e42b-4702-8416-81ffd83d3c61","resolution":{"observed_at":"2026-08-04T04:30:30.469902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04326","last_updated":"2020-08-22T07:14:30Z","snapshot_observed_at":"2026-08-02T04:10:10.902901Z","submitted_at":"2020-02-11T11:54:29Z","title":"ReClor: A Reading Comprehension Dataset Requiring Logical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04326","snapshot_observed_at":"2026-08-04T04:30:30.561818Z","title":"ReClor : A reading comprehension dataset requiring logical reasoning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.561818Z"},"links":{"cited_paper":"/paper/2002.04326","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:51eb03a02ceac90b5e269ba9d78289816301d0ad35cf90ad713a34084a06225f","observation_id":"adf9c2bf-5861-4f78-89d7-cd8ccaf75bb8","resolution":{"observed_at":"2026-08-04T04:30:30.561818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15194","last_updated":"2024-12-19T18:58:04Z","snapshot_observed_at":"2026-07-06T20:10:24.217625Z","submitted_at":"2024-12-19T18:58:04Z","title":"MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15194","snapshot_observed_at":"2026-08-04T04:30:30.646103Z","title":"MMLU-CF : A contamination-free multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.646103Z"},"links":{"cited_paper":"/paper/2412.15194","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:eed314c0991697b982abb0470931957322e2ea13b1afbfd4c0ed83bf6d4ecb51","observation_id":"468f8bbb-9c8c-448c-accf-13bc3d193157","resolution":{"observed_at":"2026-08-04T04:30:30.646103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2607.09786."}