{"as_of":"2026-08-14T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b425e5b3cd530f232d48cfe597a71e6fa4b513d007de1b501543345889f763e","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:17:59.862922Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10209/citation-record","integrity":"/paper/2608.10209/integrity","json":"/paper/2608.10209/citation-record.json","paper":"/paper/2608.10209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-14T04:17:59.686636Z","title":"Concrete problems in AI safety, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.686636Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:7e87983d400e677e4ca0f2b30c7cacef23222ae6aa9a1aee541bb37ed79b8e73","observation_id":"a940407a-d1b7-4435-90f9-b189062a0605","resolution":{"observed_at":"2026-08-14T04:17:59.686636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:01.202523Z","title":"Measuring political bias in Claude","venue":null,"work_id":"837e65bd-0900-4c47-8ea4-c759bd1273ea","year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.693517Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:168c6b732ddeaf3954635cd62a35cd01a22e66d3d573a39c49a69f6897dd7879","observation_id":"1bc19727-d728-4384-be6e-5f8a6052a8a3","resolution":{"observed_at":"2026-08-14T04:18:01.210935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-14T04:17:59.698106Z","title":"The internal state of an LLM knows when it's lying, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.698106Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:38adc83d49e3ecd4d14bf9918fc96b411c2ecb1591ca11978badea1afc20bc0b","observation_id":"3ab7e301-3aa1-4910-8a42-51fbe73230b0","resolution":{"observed_at":"2026-08-14T04:17:59.698106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-14T04:17:59.702774Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.702774Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:3b07e67f947cc16a725f13f991e7c34607c4dc8836bac50630f5d881c8e75b73","observation_id":"0728dbc1-5e0a-4ce9-82c5-b695b11f014e","resolution":{"observed_at":"2026-08-14T04:17:59.702774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.708085Z","title":"Boerner, Stephen Deems, Thomas R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.708085Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:7158474fcc431c6c2e52ad44c6ac5c0d809e3244bf0edc42868f33283748e66f","observation_id":"a5248c68-d469-4d80-9043-a6a7c99f8755","resolution":{"observed_at":"2026-08-14T04:17:59.708085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-10T11:37:23.229129Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03827","snapshot_observed_at":"2026-08-14T04:17:59.712832Z","title":"Discovering latent knowledge in language models without supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.712832Z"},"links":{"cited_paper":"/paper/2212.03827","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:5495dfce909a1a8737557e6aa5bb245fe4addbc8aa38c8e86a63a4bde0a1b316","observation_id":"ad5c8121-5601-44e6-8bce-716bff1b6c15","resolution":{"observed_at":"2026-08-14T04:17:59.712832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-13T05:02:02.370925Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-14T04:17:59.721800Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.721800Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:a99b8050dd540d1fa261ec8efb041fb125c763abfea9ecf5c1a6ecb7d230a5a2","observation_id":"d314d827-13af-455e-ad6c-9ebf322be669","resolution":{"observed_at":"2026-08-14T04:17:59.721800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:01.181043Z","title":"Eliciting latent knowledge: How to tell if your eyes deceive you","venue":null,"work_id":"bb20387d-6dd4-453a-994d-c6a4786029aa","year":2021},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.729878Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:1e7c847a953318e7b572c82e5034be23de27e25bad756516e54445029eccec9e","observation_id":"1532d86c-f36f-4370-bcec-d38badff26c4","resolution":{"observed_at":"2026-08-14T04:18:01.186919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-14T04:17:59.734216Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.734216Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:a9f6e0c394ee6d11cb90e07b78856d656e676c124c6ae5282b514e86dfccb18f","observation_id":"ad8e74f6-8a6a-4dca-aa03-5f6944d8fec8","resolution":{"observed_at":"2026-08-14T04:17:59.734216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-14T04:17:59.739636Z","title":"Bowman, Ethan Perez, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.739636Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:f5630b6b7de4a7be9c86846b3b513155cb0d2bed9599c8ef0a2fc3d96186ca36","observation_id":"c4face5c-2283-4977-9f4f-19466581e0e7","resolution":{"observed_at":"2026-08-14T04:17:59.739636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-14T04:17:59.746751Z","title":"QLoRA : Efficient finetuning of quantized LLMs , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.746751Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:a20cb3af85ee6cf2a2602d834e0e13526bb6c190facb6b26a1830b9230182a55","observation_id":"8deeab91-14d7-4f38-a260-c36fdde05c1d","resolution":{"observed_at":"2026-08-14T04:17:59.746751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05283","last_updated":"2024-10-11T20:10:53Z","snapshot_observed_at":"2026-08-12T22:48:59.629700Z","submitted_at":"2024-09-09T02:28:53Z","title":"On the Relationship between Truth and Political Bias in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05283","snapshot_observed_at":"2026-08-14T04:17:59.751481Z","title":"On the relationship between truth and political bias in language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.751481Z"},"links":{"cited_paper":"/paper/2409.05283","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:baec73e80dfd2addced7a3e6d46481bcd910890499a6c3f3fe71876313fa95d0","observation_id":"1660b117-16f9-414a-a927-d7ebe0524aea","resolution":{"observed_at":"2026-08-14T04:17:59.751481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-14T04:17:59.756004Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.756004Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:4f2eef9dc42c3b33ffeb461b577df2d6f8fc966719958def800d7bf490150b66","observation_id":"a3ef1fa3-574b-4cfa-90a8-f5f173373f36","resolution":{"observed_at":"2026-08-14T04:17:59.756004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-13T03:39:44.348538Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-08-14T04:17:59.760327Z","title":"Risks from learned optimization in advanced machine learning systems, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.760327Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:939cae62a5b5a0037978d71d5970b31b4d24d15f62ece40c2566992c7c215ea2","observation_id":"4ccd811d-2e17-4c4d-a8a6-218685ff43cb","resolution":{"observed_at":"2026-08-14T04:17:59.760327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-14T04:17:59.767334Z","title":"Language models (mostly) know what they know, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.767334Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:0f3edb6e189b8d208ff88ededa08996142f6079a429598abaca7b7e99dbebfc1","observation_id":"07504f46-8113-4612-b4ea-b006646da988","resolution":{"observed_at":"2026-08-14T04:17:59.767334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11604","last_updated":"2019-05-28T04:34:08Z","snapshot_observed_at":"2026-08-14T16:25:29.211037Z","submitted_at":"2019-05-28T04:34:08Z","title":"SGD on Neural Networks Learns Functions of Increasing Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11604","snapshot_observed_at":"2026-08-14T04:17:59.772617Z","title":"Edelman, Tristan Yang, Boaz Barak, and Haofeng Zhang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.772617Z"},"links":{"cited_paper":"/paper/1905.11604","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:42780e73b7274f15eb318fb7ffd5a9ef2023fa46c4b86471a0d66d5395a56962","observation_id":"2ec66086-0e3d-43db-936c-d436265fe252","resolution":{"observed_at":"2026-08-14T04:17:59.772617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.777339Z","title":"Natural emergent misalignment from reward hacking in production RL , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.777339Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:4906aaf75066ce5ba39c00be7b60fbb964ff1adb51d8e185e7257bfb27310279","observation_id":"2e957e4c-300d-4875-9541-0ca9b905fcd1","resolution":{"observed_at":"2026-08-14T04:17:59.777339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04585","last_updated":"2019-02-24T08:12:46Z","snapshot_observed_at":"2026-08-14T19:36:53.167878Z","submitted_at":"2018-03-13T01:15:39Z","title":"Categorizing Variants of Goodhart's Law","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04585","snapshot_observed_at":"2026-08-14T04:17:59.782461Z","title":"Categorizing variants of Goodhart 's law, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.782461Z"},"links":{"cited_paper":"/paper/1803.04585","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:7815c8cf116701454a223db6a972fec3545983118720025b478ffbbc25ee9d19","observation_id":"768a663e-8244-4445-a707-0a90224fa3fe","resolution":{"observed_at":"2026-08-14T04:17:59.782461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-14T04:17:59.786686Z","title":"The alignment problem from a deep learning perspective, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.786686Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:1c4fd028a103a2dfcac8a0910dfdbcdecb6d8362afe4647c8c1b3c01839308e0","observation_id":"745f7d37-64b8-4d71-ac37-90849517e8c3","resolution":{"observed_at":"2026-08-14T04:17:59.786686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-14T04:17:59.791545Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.791545Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:ccddc20d1ea747ff0bc45f78e601ee8df631da5aa1b0460183b7103665f8f9d2","observation_id":"2dd13208-9c3f-41db-a050-f9db41382677","resolution":{"observed_at":"2026-08-14T04:17:59.791545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-13T04:40:05.019883Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-14T04:17:59.796035Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.796035Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:20ab20ad71a839cadad40679a6bd40a8b939cb8cc5c17f32a520fc9fff79cc6b","observation_id":"e8f00cd7-f125-4cc5-a484-0388ae6fc566","resolution":{"observed_at":"2026-08-14T04:17:59.796035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-14T04:17:59.800654Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.800654Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:9c6c8992dc9f7f5f4470eb2ab3ae084594d792c8bfa5b77e5ccdfd0dffaf6297","observation_id":"484ec70b-f921-4e9e-983b-99a690623927","resolution":{"observed_at":"2026-08-14T04:17:59.800654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-14T04:17:59.805283Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.805283Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:df559d8c056e58beef6c7e4649eea5796785090955ac9ec303348aae01c0e708","observation_id":"e1cec0d2-b5a3-4ae4-8ed2-1b58c08b1be4","resolution":{"observed_at":"2026-08-14T04:17:59.805283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08734","last_updated":"2019-05-31T13:45:08Z","snapshot_observed_at":"2026-08-14T19:00:28.034745Z","submitted_at":"2018-06-22T15:39:05Z","title":"On the Spectral Bias of Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08734","snapshot_observed_at":"2026-08-14T04:17:59.809491Z","title":"Hamprecht, Yoshua Bengio, and Aaron Courville","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.809491Z"},"links":{"cited_paper":"/paper/1806.08734","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:07cdef06ebc0e757ead1add9503e056fb324e9effacee361bbde119bebf5a98c","observation_id":"6124cd75-fc2f-4c8a-8dd5-1d484253f19c","resolution":{"observed_at":"2026-08-14T04:17:59.809491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:01.145298Z","title":null,"venue":null,"work_id":"dd5d06d4-b016-4bee-b0df-b014db6a334c","year":2023},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.814145Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:3f99aaf98bd902901d0cae66375368b17c20b388eddb4d58fe856304b7d526be","observation_id":"67ff7e07-67ae-45d8-8463-9eea83e2a93e","resolution":{"observed_at":"2026-08-14T04:18:01.163686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T04:17:59.822017Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.822017Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:d89a4ff524f6e1f418da74b9e22857c1c1099d5ee184661fd7a257b0e2808b2e","observation_id":"0f81ba7d-5427-4d0d-ab0d-64da85f6dcc6","resolution":{"observed_at":"2026-08-14T04:17:59.822017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-14T07:24:06.483860Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-14T04:17:59.828256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.828256Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:27c37432567ed8d310c3316558d0a8f249579ca9abf54c82c4ba032b81323e99","observation_id":"70b8a9c3-467a-4eff-a4ce-6e9bf5c5cdce","resolution":{"observed_at":"2026-08-14T04:17:59.828256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-14T04:17:59.845655Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.845655Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:984dd1d479667436c020f89d9b5b80092e80d19bd9b8f779e5acdb14712a26b0","observation_id":"8897593c-21db-4e5e-82de-8e61f6e842a1","resolution":{"observed_at":"2026-08-14T04:17:59.845655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.850544Z","title":"Inoculation prompting: Eliciting traits from LLMs during training can suppress them at test-time, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.850544Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:6f96418bcb904230296b01ef08cc2e4328440193a51b31b56ceec2698dabab41","observation_id":"ff6f8909-8f9b-422f-a18f-1469f7c91ff8","resolution":{"observed_at":"2026-08-14T04:17:59.850544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08522","last_updated":"2019-04-21T10:16:54Z","snapshot_observed_at":"2026-08-14T19:12:33.159378Z","submitted_at":"2018-05-22T11:51:36Z","title":"Deep learning generalizes because the parameter-function map is biased towards simple functions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08522","snapshot_observed_at":"2026-08-14T04:17:59.855765Z","title":"Camargo, and Ard A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.855765Z"},"links":{"cited_paper":"/paper/1805.08522","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:eb38c0849e6e797c7d4397fef289d0c46fd0f81e31350799dc20a45e5cc5976d","observation_id":"5c435b4a-93a8-44f1-a40f-6e524e070d3c","resolution":{"observed_at":"2026-08-14T04:17:59.855765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:17:59.862922Z","title":"Inoculation prompting: Instructing LLMs to misbehave at train-time improves test-time alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.862922Z"},"links":{"citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:220a990780fe2d69c63e3256502b7e185821a3bb4e43b006fd68abecc672bbc1","observation_id":"4f4f9820-c79c-477a-9f39-3968f834b1a3","resolution":{"observed_at":"2026-08-14T04:17:59.862922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T21:09:56.611277Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.10209."}