{"as_of":"2026-08-07T19:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b5f5a41f233329538e76150fd2fb738095b2610acb5f6f53834ea91a0d7b4c4","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:03:55.246559Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:51:52.262506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T15:34:47.983586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T10:53:00.347387Z","title":"Sahara Shrestha","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23330","last_updated":"2025-07-31T08:22:49Z","snapshot_observed_at":"2026-08-06T10:52:59.828799Z","submitted_at":"2025-07-31T08:22:49Z","title":"AI Must not be Fully Autonomous","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:00.347387Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2507.23330"},"observation_digest":"sha256:fa0eba11f02cf50e2950527e04500a5a0799e53e9360eaf5c7c7de43f6d02601","observation_id":"37af238e-3c66-48b7-b8d8-4a01d16a4f31","resolution":{"observed_at":"2026-08-06T10:53:00.347387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:c246452351ed4e6c6be4bc5f997e554809da2eae9ca41b8f62c7609912fa7738","observation_id":"d02bf6ef-1025-4236-a04c-8720533ff381","resolution":{"observed_at":"2026-05-10T14:00:28.296337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.02964","last_updated":"2026-05-03T07:10:42Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T07:10:42Z","title":"Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T15:38:41.821264Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.02964"},"observation_digest":"sha256:e020bf50250c13943e6550c8ccdf5c98e4454ac963452a931ebbb71098eac800","observation_id":"3b8e5177-58e3-46eb-a943-98ca9ca8c001","resolution":{"observed_at":"2026-05-11T10:06:03.602626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.24286","last_updated":"2026-05-22T23:37:29Z","snapshot_observed_at":"2026-07-31T20:22:37.981127Z","submitted_at":"2026-05-22T23:37:29Z","title":"Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T15:29:34.096277Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.24286"},"observation_digest":"sha256:a9800403b4e247d91344796266471b82e47e1624105f6ff12729353b20020c76","observation_id":"86df5f34-fae7-474a-989e-fb04c900df8c","resolution":{"observed_at":"2026-06-30T15:34:47.985017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-08-07T18:03:32.505412Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:745808c46670407aa6ace0653d5f29e4038f42291363a4740b8a8007e5e3dd8a","observation_id":"57d7f00b-157e-4cc2-a731-ce0ac2d98dd7","resolution":{"observed_at":"2026-06-30T12:24:39.625126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.207562Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T19:20:33.314238Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.207562Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:3d1b94e205f9287da37cecb6a3f26f242c51bda82b6bf4fc94a394b2a39ea0d2","observation_id":"fc5cb71a-18b1-49eb-a2ec-5d8a375928a1","resolution":{"observed_at":"2026-08-06T17:51:52.207562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.262506Z","title":"arXiv preprint arXiv:2506.22777 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-07T19:20:33.314238Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.262506Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:a370266d589a12a545e37117ff3b36c5dd16fe843475b14c351ca7ea8b95e0fb","observation_id":"8daac443-4250-474f-8592-87fb3f5eef50","resolution":{"observed_at":"2026-08-06T17:51:52.262506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22777/citation-record","integrity":"/paper/2506.22777/integrity","json":"/paper/2506.22777/citation-record.json","paper":"/paper/2506.22777"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.08574","last_updated":"2024-06-26T19:52:35Z","snapshot_observed_at":"2026-08-05T14:30:41.507825Z","submitted_at":"2024-01-16T18:58:37Z","title":"Deductive Closure Training of Language Models for Coherence, Accuracy, and Updatability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08574","snapshot_observed_at":"2026-08-06T22:03:50.441783Z","title":"F., Akyürek, E., Choshen, L., Wijaya, D., and Andreas, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.441783Z"},"links":{"cited_paper":"/paper/2401.08574","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:99c463d241ccc91989f4a1856019d984bb109caf9a942997b87864e45da68f52","observation_id":"f21d7222-a4fa-4ed0-83a0-10f82d45ea24","resolution":{"observed_at":"2026-08-06T22:03:50.441783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.681184Z","title":"Claude 3.7 sonnet system card, 2025","venue":null,"work_id":"48c3d8ff-bb8a-4859-8d37-2efed249989c","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.497422Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:895582eeb26cd5b52d4c8cb493ced9ccfb2b6039aabcbb56359ba4b13598fcf4","observation_id":"ff74f8e3-c968-4801-8c60-1943027adc10","resolution":{"observed_at":"2026-08-06T22:04:01.747302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.504130Z","title":"System card: Claude opus 4 & claude sonnet 4, 2025","venue":null,"work_id":"bd31dc8b-9bbc-4b79-80ff-916af46a9960","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.661471Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:79689a79d04ab8a157e5575613333899050f6c8a01cf2feb98fab96b341f8eda","observation_id":"302fb93a-fc55-4419-bffc-fe5132b7ef40","resolution":{"observed_at":"2026-08-06T22:04:01.576798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-07T17:12:11.913580Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-06T22:03:50.831268Z","title":"Chain-of-thought reasoning in the wild is not always faithful.arXiv preprint arXiv:2503.08679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.831268Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:9848f724b7dd6805129032cb29709f8252e4449bc97c9a029616d6a2eddd5537","observation_id":"2ad3bb70-9718-4362-9b7b-5b5f34ad5512","resolution":{"observed_at":"2026-08-06T22:03:50.831268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.329326Z","title":"Do models say what they learn?, 2025","venue":null,"work_id":"d5e2f554-b6a8-4caa-ac70-dcf90043bef1","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.892798Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:2db8900117af4ea2bbab418a76a5583eaa35dcfda4fc8126774f82df87bcc88d","observation_id":"239f0235-1f8c-40fb-b310-915a321296d4","resolution":{"observed_at":"2026-08-06T22:04:01.427022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.110449Z","title":"CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring, May 2025","venue":null,"work_id":"62b11bef-4c95-4c66-9663-b2de19adf736","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.084035Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d772c426d0ebb83be5d71a2d49e3ee2c6634cbc3d45b3d5fb5e20092eccdbe44","observation_id":"c841f2e4-0213-4768-924c-436d2805774b","resolution":{"observed_at":"2026-08-06T22:04:01.189283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-06T22:03:51.211271Z","title":"Y., Madry, A., Zaremba, W., Pachocki, J., and Farhi, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.211271Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d273c80b00afa06ea09afcc749dfdf63adac010471d243b1bffda2eb816e0c07","observation_id":"a3b04bbd-4df7-4467-88d2-39c5d647e735","resolution":{"observed_at":"2026-08-06T22:03:51.211271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.933573Z","title":"C., Macar, U., Nanda, N., and Conmy, A","venue":null,"work_id":"70389d64-c08f-495d-b5b1-d40f844b0774","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.342380Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:14cecf60aef103300f0982163bda8c78374122606db91839eb62a2d2484ca83d","observation_id":"616b1434-3fc4-4f52-b899-1ce6c2dff02c","resolution":{"observed_at":"2026-08-06T22:04:00.996924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-08-06T22:03:51.583235Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.583235Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:0f7865dab3d0c7297c5d56d0cdaee8340682ada3d08d7d199a4f4c8c5236b2b7","observation_id":"1bde6da0-f4f3-4a8c-9f28-1afffd67c247","resolution":{"observed_at":"2026-08-06T22:03:51.583235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08678","last_updated":"2023-07-17T17:41:47Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:41:47Z","title":"Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08678","snapshot_observed_at":"2026-08-06T22:03:51.721948Z","title":"Do models explain themselves? counterfactual simulatability of natural language explanations.arXiv preprint arXiv:2307.08678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.721948Z"},"links":{"cited_paper":"/paper/2307.08678","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:a0bfc7b3e8c53970dc9e5e321d973cd255778016cf784ce99aa647d0db1abc08","observation_id":"54d38c93-7ef8-4d85-8794-6adf0cf2c45a","resolution":{"observed_at":"2026-08-06T22:03:51.721948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13986","last_updated":"2024-01-25T07:04:30Z","snapshot_observed_at":"2026-07-06T17:20:17.051503Z","submitted_at":"2024-01-25T07:04:30Z","title":"Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13986","snapshot_observed_at":"2026-08-06T22:03:51.842152Z","title":"Towards consistent natural-language explanations via explanation-consistency finetuning.arXiv preprint arXiv:2401.13986, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.842152Z"},"links":{"cited_paper":"/paper/2401.13986","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:53384f43d6d2f55f5907e2c467ed3919aa4c44beadf84439418675b251d37a08","observation_id":"34c38ac9-afcd-4cee-aaa6-c721edec54f4","resolution":{"observed_at":"2026-08-06T22:03:51.842152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T22:03:51.958119Z","title":"Reasoning models don’t always say what they think.arXiv preprint arXiv:2505.05410, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.958119Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:8904370251ab008273e6d2f283a5039706e932eb3968a55cc0839c81c3ae20fe","observation_id":"2170fee5-fc74-4209-a415-4a639f0c0b89","resolution":{"observed_at":"2026-08-06T22:03:51.958119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-07T00:12:18.159200Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-06T22:03:52.114166Z","title":"and Evans, O","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.114166Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:22ee04ae26b1ed7be1ae86882f67766200058b97acdbfb368d9b381edbb38131","observation_id":"dc59f3ac-4435-40e3-8787-ad58d3430371","resolution":{"observed_at":"2026-08-06T22:03:52.114166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05518","last_updated":"2025-06-26T19:29:49Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:41:42Z","title":"Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05518","snapshot_observed_at":"2026-08-06T22:03:52.256909Z","title":"R., Michael, J., Perez, E., and Turpin, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.256909Z"},"links":{"cited_paper":"/paper/2403.05518","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:432757aa50b3b425e05af1b1973027f114f3ae89bc6149435b739d6cb17a3df7","observation_id":"246b518d-1ab1-4735-b78f-3311d85ac3f2","resolution":{"observed_at":"2026-08-06T22:03:52.256909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-07T00:34:41.294853Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T22:03:52.409376Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.409376Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:00d2bab91bc83c8915aeb60925671c762b76261393d63e9b49696e8418401d88","observation_id":"f6e3de66-b89d-45fb-87f8-5ed1d36b1be9","resolution":{"observed_at":"2026-08-06T22:03:52.409376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-06T22:03:52.532834Z","title":"Sycophancy to subterfuge: Investigating reward-tampering in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.532834Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d3512e7937f82cdf9eec6b5baa2a8f7892d4006b3ba4f3e8ef155b82b0f773af","observation_id":"e88a03ae-e068-4566-afa0-7d8f94d08bff","resolution":{"observed_at":"2026-08-06T22:03:52.532834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08608","last_updated":"2017-03-02T19:32:10Z","snapshot_observed_at":"2026-08-07T08:20:39.814613Z","submitted_at":"2017-02-28T02:19:20Z","title":"Towards A Rigorous Science of Interpretable Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.08608","snapshot_observed_at":"2026-08-06T22:03:52.662856Z","title":"and Kim, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.662856Z"},"links":{"cited_paper":"/paper/1702.08608","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:7f90ca429d8c253b6fe32170e863f38c0a76f5d74383342060985a197961ec1a","observation_id":"fb9bf395-747d-4440-9fa5-1021e695b54d","resolution":{"observed_at":"2026-08-06T22:03:52.662856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13011","last_updated":"2025-04-10T16:25:31Z","snapshot_observed_at":"2026-07-06T20:24:31.858337Z","submitted_at":"2025-01-22T16:53:08Z","title":"MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13011","snapshot_observed_at":"2026-08-06T22:03:52.729172Z","title":"Mona: Myopic opti- mization with non-myopic approval can mitigate multi-step reward hacking.arXiv preprint arXiv:2501.13011, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.729172Z"},"links":{"cited_paper":"/paper/2501.13011","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:6fc00d89f0093fe2e9f970bfddaf0d8ead9b8d7ce0b19b6472bcaeca742eec91","observation_id":"cad4fade-f35b-4ddc-a36e-bd417372e751","resolution":{"observed_at":"2026-08-06T22:03:52.729172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:03:52.823979Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.823979Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:8f5ea77f11e75d367aacabb82977be6211e36d5f29d8d9d80cc908b46d5f2ac3","observation_id":"682d30aa-73aa-499d-ba2c-27781aec2e4f","resolution":{"observed_at":"2026-08-06T22:03:52.823979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T22:03:52.897092Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.897092Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:df2bc53bdeaf099acfa9fa52822332b6dda03d25bdfcfb1fc26d27f05ff80c70","observation_id":"476651c5-f936-451d-a94b-c1b54da0d379","resolution":{"observed_at":"2026-08-06T22:03:52.897092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01831","last_updated":"2020-05-04T20:35:17Z","snapshot_observed_at":"2026-07-06T09:17:36.348212Z","submitted_at":"2020-05-04T20:35:17Z","title":"Evaluating Explainable AI: Which Algorithmic Explanations Help Users Predict Model Behavior?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01831","snapshot_observed_at":"2026-08-06T22:03:53.060892Z","title":"and Bansal, M","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.060892Z"},"links":{"cited_paper":"/paper/2005.01831","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:aefbeb877d680f1014720be2e94f7b58cdd4f264bdab1f203dc30c99e6a7b785","observation_id":"d54daab9-5337-4536-bacc-7e43417a0aa8","resolution":{"observed_at":"2026-08-06T22:03:53.060892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.737014Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":"61cd4243-185a-41b4-a1ce-66175b3618ab","year":2020},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.178068Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:33fd5d97fc296e8ae60144fe71b5311b6ddc86732f297148005fa54f02309847","observation_id":"d1ba6d7d-cae9-410d-b8a7-40ee24609032","resolution":{"observed_at":"2026-08-06T22:04:00.831058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03685","last_updated":"2020-04-27T20:44:37Z","snapshot_observed_at":"2026-07-06T09:10:46.033625Z","submitted_at":"2020-04-07T20:15:28Z","title":"Towards Faithfully Interpretable NLP Systems: How should we define and evaluate faithfulness?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03685","snapshot_observed_at":"2026-08-06T22:03:53.317192Z","title":"and Goldberg, Y","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.317192Z"},"links":{"cited_paper":"/paper/2004.03685","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:fb402cb4867d7619a80302a1569fc5e9a9fe68b189d0bc00bf904cb59aaf9ae1","observation_id":"34491400-e581-485d-9654-5ade983b4683","resolution":{"observed_at":"2026-08-06T22:03:53.317192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T22:03:53.461451Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.461451Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:dd51b94c662b47db427ca8f9464ac37b77d368987d483701aef8c925baadd18d","observation_id":"e1f3071f-7371-4d66-b1ea-1d360ba676e1","resolution":{"observed_at":"2026-08-06T22:03:53.461451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13692","last_updated":"2024-08-01T17:18:54Z","snapshot_observed_at":"2026-07-06T18:48:37.723242Z","submitted_at":"2024-07-18T16:58:18Z","title":"Prover-Verifier Games improve legibility of LLM outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13692","snapshot_observed_at":"2026-08-06T22:03:53.640168Z","title":"H., Chen, Y., Edwards, H., Leike, J., McAleese, N., and Burda, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.640168Z"},"links":{"cited_paper":"/paper/2407.13692","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:5bca8b18dfd560b5a73fb9b14ecf4b6c6d432876c4af0391fb32f1c9f9bf269f","observation_id":"dfcd6065-a185-47b4-a818-df84799aadc4","resolution":{"observed_at":"2026-08-06T22:03:53.640168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-06T22:03:53.828913Z","title":"Measuring faithfulness in chain-of-thought reasoning.arXiv preprint arXiv:2307.13702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.828913Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:bfd2115c0c62934220dec6f3e9e826190e15cce5871383962e0b4a0645343634","observation_id":"910bb57f-c351-4715-8196-5f40abf2c201","resolution":{"observed_at":"2026-08-06T22:03:53.828913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.568134Z","title":null,"venue":null,"work_id":"33cd7bf2-3af9-4bb8-ac24-a129769a5906","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.978883Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:08967ea3fca0954dd0baee9117b4707b1173df2b5c9cdfe0c84a88033fef6c33","observation_id":"f87c9427-f11e-48c6-b9c4-899d25c0878f","resolution":{"observed_at":"2026-08-06T22:04:00.660472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.315393Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":"79d26969-50c5-4aea-bf63-7e11a15888d6","year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.086785Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:b43af72ed6a5d588cdd6c63ccfbf7aab3b3b258c4bccda4fab7350f3d469c63f","observation_id":"81be3c40-872a-4346-a988-6ed51f211c33","resolution":{"observed_at":"2026-08-06T22:04:00.394410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-29T23:20:20.918596Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-06T22:03:54.197470Z","title":"Frontier models are capable of in-context scheming.arXiv preprint arXiv:2412.04984, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.197470Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:befbe3b49e3045fb627f308358111956354650b5874c5677d55cd684e1f9050c","observation_id":"f3524604-2834-40fb-af44-93a9b9fd599f","resolution":{"observed_at":"2026-08-06T22:03:54.197470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11768","last_updated":"2023-07-25T04:01:43Z","snapshot_observed_at":"2026-07-06T15:57:04.900537Z","submitted_at":"2023-07-17T00:54:10Z","title":"Question Decomposition Improves the Faithfulness of Model-Generated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11768","snapshot_observed_at":"2026-08-06T22:03:54.287418Z","title":"Question decomposition improves the faithfulness of model-generated reasoning.arXiv preprint arXiv:2307.11768, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.287418Z"},"links":{"cited_paper":"/paper/2307.11768","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d5e62dbb66303e54a6d252faff58c307fff99daa44581a2f164c4fc0b6af3eec","observation_id":"dbef506a-d2e8-4f1b-8ca0-42d10430c43e","resolution":{"observed_at":"2026-08-06T22:03:54.287418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18512","last_updated":"2023-10-31T19:13:43Z","snapshot_observed_at":"2026-08-06T07:03:02.030103Z","submitted_at":"2023-10-27T22:02:29Z","title":"Preventing Language Models From Hiding Their Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18512","snapshot_observed_at":"2026-08-06T22:03:54.383501Z","title":"and Greenblatt, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.383501Z"},"links":{"cited_paper":"/paper/2310.18512","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:cb8e8cbcd0821a4f9a2d3d2f370ed41bd91650539f7c844bfbb0e0c19223bf3d","observation_id":"67be5f1f-89f9-49de-b9de-97969602ee1a","resolution":{"observed_at":"2026-08-06T22:03:54.383501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.107763Z","title":"J., and Radmard, P","venue":null,"work_id":"b4f17132-e467-45a8-94bd-0f7a446eba13","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.445456Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:3ef55911bc6dc81b7e3cafd8545e52d5217b1f1326fb649bfef8ffcefdbfeb05","observation_id":"9ffb1065-8644-47bb-8c77-fba73dfbe0ea","resolution":{"observed_at":"2026-08-06T22:04:00.213345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:59.931658Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting.Advances in Neural Information Processing Systems, 36: 74952–74965, 2023","venue":null,"work_id":"36be4a95-f6d4-4ea3-85d7-b14b415cf960","year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.498071Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:70dbcefc33745e0d3dca994f963698278e36f33276421ed367e01db1713c4349","observation_id":"191524fa-188c-4c1a-9e66-bdf657dc5058","resolution":{"observed_at":"2026-08-06T22:04:00.025428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:59.607146Z","title":"V ., and Zhou, D","venue":null,"work_id":"7633efe9-35cb-48f6-acc4-7d5320fa83b5","year":2022},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.613723Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:919f251901e59a3eae65609247c005fb79163082b04ac489622dc2a447fccffe","observation_id":"365824e4-ee44-45c8-b5b5-2e03d6195ba9","resolution":{"observed_at":"2026-08-06T22:03:59.849231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:57.400139Z","title":"Stanford professor","venue":null,"work_id":"2e738b2c-0b93-4c32-ae1a-9db25a08b4d8","year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.726523Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:013a777169d8f22321ad801c80540b1e2c5ea252eda2c18e6a6d8c8371f44159","observation_id":"77a23d7b-eb7a-4ae6-a728-63ce0e16f3ee","resolution":{"observed_at":"2026-08-06T22:03:59.485553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:56.339289Z","title":null,"venue":null,"work_id":"4b716c94-e18b-46e9-a65e-a2769b1bcd9f","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.841726Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:6eb17e4a412c5347527b8fd0191a3137100b8723b17d3d5a5fa21547bd4ac956","observation_id":"c5a228f6-007e-4f2a-8cda-5db18b5855ff","resolution":{"observed_at":"2026-08-06T22:03:56.417600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:56.095896Z","title":null,"venue":null,"work_id":"935b87f2-66d8-4063-8c65-e460e536a9c5","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.998600Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:db04c6f0422ba49aba205e14dbbf7ec90ae9e689252a741d0699b34f72813ff4","observation_id":"44717e3c-8013-4a51-99d8-93bce8d1dc22","resolution":{"observed_at":"2026-08-06T22:03:56.224533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:55.920752Z","title":"In some cases the bias will be toward the correct answer so in some cases briefly con si de r if the biased answer seems p l a u s i b l e","venue":null,"work_id":"41dfe8fd-976b-4af9-8ed3-6661ba930399","year":2020},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:55.131494Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d011849809db748be454401a48128e93013855605bb5eaab80a6afcd4ed5c24f","observation_id":"3373f97b-cddf-4b46-851e-3e81004aa31b","resolution":{"observed_at":"2026-08-06T22:03:56.014356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:55.718027Z","title":"emotivism","venue":null,"work_id":"265b455d-4c79-48b8-ab47-ea4e5882e238","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:55.246559Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:8c22a630ce84041cbf504b9444d3753fccfbe861ea8347bfd44e7b33344fcd69","observation_id":"b6f3221a-d240-4ea6-a402-1de50dfb289e","resolution":{"observed_at":"2026-08-06T22:03:55.825385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:51.437235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.437235Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:2e4a18aa3a516340362fa4f189ffd1096c942dd580067fa77e9d4414a2f42f11","observation_id":"8f19acc5-3cfa-4e71-be6a-08e0adfc46c6","resolution":{"observed_at":"2026-08-06T22:03:51.437235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T21:55:34.287424Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 7 inbound Pith citation observations for arXiv:2506.22777."}