{"as_of":"2026-08-12T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc9eac2a48d81a41988e2293326e6b2dc722c58506acab1a8ec0524d35274f6f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:21:26.846278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T09:04:53.129737Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2210.10760"},"observation_digest":"sha256:3d9909e11a79cd0ea8a44297474a67a94200e3aa3bdb172d1e5d35eea058da1e","observation_id":"aa536ffd-66f9-4070-9524-9b6dd090c5e4","resolution":{"observed_at":"2026-05-19T09:04:53.379647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2310.15288","last_updated":"2026-05-07T22:20:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-23T18:54:43Z","title":"Active teacher selection for reward learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T05:54:43.873174Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2310.15288"},"observation_digest":"sha256:0d620ec9fcb83e0ef67678504985cd78dfcff609c7ae911255aedf5ab1ec7d64","observation_id":"5773e748-c95b-40e6-93a4-cf831ff83936","resolution":{"observed_at":"2026-05-24T05:56:01.756834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-10T23:21:26.846278Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20834","last_updated":"2024-12-30T09:58:31Z","snapshot_observed_at":"2026-08-12T06:33:00.480098Z","submitted_at":"2024-12-30T09:58:31Z","title":"Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:26.846278Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2412.20834"},"observation_digest":"sha256:895dd434e8c1f9e516db66dd61e3a9db2fb8d2af785736ac6597c73e5601ee59","observation_id":"611ae39f-2683-4c20-a934-530fa9aab837","resolution":{"observed_at":"2026-08-10T23:21:26.846278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-09T18:55:14.733622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01667","last_updated":"2025-02-01T16:08:43Z","snapshot_observed_at":"2026-08-12T13:07:22.151043Z","submitted_at":"2025-02-01T16:08:43Z","title":"Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T18:55:14.733622Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2502.01667"},"observation_digest":"sha256:6820a17c78a3e16f8b101fd7d839f8dcd4168460f8b4e999a011e46bf9c2bbca","observation_id":"840a7906-fad3-44d9-ad91-31b0138088e7","resolution":{"observed_at":"2026-08-09T18:55:14.733622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-09T06:01:13.375740Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-10T19:48:51.143556Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T06:01:13.375740Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2502.04371"},"observation_digest":"sha256:0adc40037bd55ffe0a411d442c7d71b8f1f30212cd9b0897d8dbefa81dd0fd83","observation_id":"340454bf-41ff-4566-acd5-cf0b8992b76b","resolution":{"observed_at":"2026-08-09T06:01:13.375740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-07T15:15:46.420808Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17122","last_updated":"2025-05-21T17:59:02Z","snapshot_observed_at":"2026-08-08T23:38:32.695642Z","submitted_at":"2025-05-21T17:59:02Z","title":"Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:46.420808Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2505.17122"},"observation_digest":"sha256:d11fc53180930fd610e110dd54876fa271e8e981ce7ba2a3a73f7d229600a7cf","observation_id":"03ae14d6-fb94-4686-9f1a-5dde4f332355","resolution":{"observed_at":"2026-08-07T15:15:46.420808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-06T21:34:45.116682Z","title":"Defining and characterizing reward hacking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23844","last_updated":"2025-06-30T13:34:34Z","snapshot_observed_at":"2026-08-08T15:24:13.507722Z","submitted_at":"2025-06-30T13:34:34Z","title":"A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:45.116682Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2506.23844"},"observation_digest":"sha256:2566104449c3d4c30715f67bf9a8fe43a3f8ed14e78293d0b4a66091cf099fde","observation_id":"07c83c84-8bf8-4f04-a97d-837fae7723ea","resolution":{"observed_at":"2026-08-06T21:34:45.116682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-06T21:17:35.995519Z","title":"Defining and characterizing reward hacking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00611","last_updated":"2025-07-01T09:43:57Z","snapshot_observed_at":"2026-08-12T13:27:21.603825Z","submitted_at":"2025-07-01T09:43:57Z","title":"Residual Reward Models for Preference-based Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:35.995519Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2507.00611"},"observation_digest":"sha256:cea4093cee1f7dbd8be62d9341da1104fbdbe08ae6863041acec1db046c6c8f0","observation_id":"99a48b61-255b-484e-904d-5a0328c85069","resolution":{"observed_at":"2026-08-06T21:17:35.995519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-06T14:13:07.057759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.057759Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:141b8cfcc8b8488328fc2ff69ed4c7125bda3617e086c8c7004391fd1a30a907","observation_id":"4da1e97b-90e6-4823-a301-886c258826fa","resolution":{"observed_at":"2026-08-06T14:13:07.057759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-07T00:23:51.691004Z","title":"Defining and Characterizing Reward Hacking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21082","last_updated":"2025-06-17T07:13:35Z","snapshot_observed_at":"2026-08-10T01:01:06.386623Z","submitted_at":"2025-06-17T07:13:35Z","title":"Safety Features for a Centralised AGI Project","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:51.691004Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2507.21082"},"observation_digest":"sha256:799b58358feecdcda62ec3c3a261a5891351a7c1369706e7508d2ba44e1e1315","observation_id":"7d433f92-f7f2-4d7a-ad5b-1f647bc356da","resolution":{"observed_at":"2026-08-07T00:23:51.691004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T16:57:09.545711Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17511","last_updated":"2025-08-24T20:23:08Z","snapshot_observed_at":"2026-08-09T21:24:47.928571Z","submitted_at":"2025-08-24T20:23:08Z","title":"School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T16:57:09.545711Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2508.17511"},"observation_digest":"sha256:0d11efc6d21a1e89d92c21d3d8b721423ac405dea0f6633f2ae397fab6eaa52a","observation_id":"6e307ebc-94ba-4061-acc0-74ecd3b48a5a","resolution":{"observed_at":"2026-08-05T16:57:09.545711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:dbb9df92fa2f543a28203e9765cf9a19edb5b79834d479770802ef8c91ca3952","observation_id":"757c9522-2a47-4aac-adf5-43d0d48bbf2e","resolution":{"observed_at":"2026-05-18T14:02:39.850063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-04T10:53:09.398856Z","title":"arXiv:2209.13085 [cs.LG] https://arxiv.org/abs/2209.13085","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.398856Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:2aa740b243cfe4d2e2d665fdc1741095df4c55bca6f734ef51534356da6fe1cc","observation_id":"73dfea2d-def0-4b49-b3ad-a517d841eae6","resolution":{"observed_at":"2026-08-04T10:53:09.398856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-03T16:43:56.945344Z","title":"Tang, Y ., Wang, S., Madaan, L., and Munos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:56.945344Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:c6a46e0e9747aa57e429524426f16778fc371a49e3848ce2979da81b53bdd55a","observation_id":"571222e9-820a-477a-ac3c-11adea58878b","resolution":{"observed_at":"2026-08-03T16:43:56.945344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-07-13T10:33:19.825936Z","title":"Skalse, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04247","last_updated":"2026-04-05T20:07:48Z","snapshot_observed_at":"2026-07-13T10:33:16.289426Z","submitted_at":"2026-04-05T20:07:48Z","title":"Combee: Scaling Prompt Learning for Self-Improving Language Model Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T10:33:19.825936Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.04247"},"observation_digest":"sha256:423f9277f793808d3078cb836216e76a517ea0ca279475ac30e94574b9ffcfe7","observation_id":"49f77dec-b6b2-4d47-8be2-d575d9e0c5d3","resolution":{"observed_at":"2026-07-13T10:33:19.825936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.13801","last_updated":"2026-04-15T12:37:40Z","snapshot_observed_at":"2026-08-11T11:52:28.916838Z","submitted_at":"2026-04-15T12:37:40Z","title":"DUET: Joint Exploration of User Item Profiles in Recommendation System","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T12:40:04.613964Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.13801"},"observation_digest":"sha256:7da3abbce7927d745cba85861c7dc1879db52ec34e95c517f4bf22bc91874297","observation_id":"e96c1b9e-3e77-4d2b-8b2a-0447ab893578","resolution":{"observed_at":"2026-05-10T12:40:23.616293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.15597","last_updated":"2026-04-17T00:33:32Z","snapshot_observed_at":"2026-07-06T23:03:07.228701Z","submitted_at":"2026-04-17T00:33:32Z","title":"LLMs Corrupt Your Documents When You Delegate","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-10T09:47:21.966292Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.15597"},"observation_digest":"sha256:a077d1d10eeef86139969bea11252e22bf80338eba418673bfa853e92d4530fe","observation_id":"5e56343a-906c-4e92-b33a-e70abd30ca5d","resolution":{"observed_at":"2026-05-10T09:48:47.599512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.23338","last_updated":"2026-05-06T17:17:02Z","snapshot_observed_at":"2026-08-06T19:46:39.219000Z","submitted_at":"2026-04-25T14:57:15Z","title":"A Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents: A Layered Attack Surface Framework","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T07:53:13.746141Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.23338"},"observation_digest":"sha256:2a61833a11c215c30c202e25c896ea5b498ca8c2dc18d7abc9192645d4832571","observation_id":"0cc6721b-4000-4f66-b163-5d6aee3ba069","resolution":{"observed_at":"2026-05-11T20:51:09.369103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T17:58:26.932519Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:4c254dd1a0242c5a83eb6005d9e9f51f98177026a255d811f3d4cc9a30e933e3","observation_id":"4a8a8d5b-ad56-412a-a141-0550e525169c","resolution":{"observed_at":"2026-05-11T23:11:17.631038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T07:20:52.825158Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:49e77cebff741f227389ecd103058ec09de4097f24ae41c79225c34ec2d11810","observation_id":"634c0313-ca5c-4d71-8873-52e250e02ec7","resolution":{"observed_at":"2026-05-13T07:22:28.781994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T09:24:17.904893Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:4ec8f00038cd6ef0f591c044f5bbcb6d00cf3ab1f7e08adf5c666a3fabb10d7d","observation_id":"ffac88c2-d468-4c23-9b97-1b7a830e0669","resolution":{"observed_at":"2026-07-01T09:25:39.876048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-02T15:29:49.171054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T15:29:49.171054Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:3b4cfd3568c268ca6c94e4e3ec208685c9e687c3da3985a5ecdbe3f4fc543134","observation_id":"584c3de6-7b35-4d39-8665-045611652215","resolution":{"observed_at":"2026-08-02T15:29:49.171054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:334509bbefdb3bb4535e9df62a690076d8a9c2a1ae193fd436dfc5ebe105e39d","observation_id":"a759e4eb-cc9c-4a0b-ad50-f494eeffb4b2","resolution":{"observed_at":"2026-05-11T23:16:16.302983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-08-11T05:02:35.231150Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:f89c9b4ab6f4114816aedc7912ba044476c50ffdd78938f3ff5077b83417ea25","observation_id":"bfb8015f-5e33-47bc-999f-1209b38f7bdf","resolution":{"observed_at":"2026-05-10T19:00:45.572142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2605.11859","last_updated":"2026-05-12T09:43:21Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:43:21Z","title":"EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:19:38.587352Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2605.11859"},"observation_digest":"sha256:5b30d85c214c3d7e24c4e783cf454aa13242caa9777c7dda105ebf0412f7223b","observation_id":"ad862279-0362-4a2d-aadc-df70b02a5a58","resolution":{"observed_at":"2026-05-13T05:27:18.899889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2605.12673","last_updated":"2026-05-12T19:22:45Z","snapshot_observed_at":"2026-08-11T17:02:03.648073Z","submitted_at":"2026-05-12T19:22:45Z","title":"Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:50.043920Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2605.12673"},"observation_digest":"sha256:4043e8b7abcef9c8e76b26c946298ddfa2f3b4049f593d8c31190ee07e89318f","observation_id":"d4512d50-caf6-408d-91fd-53055ffd103e","resolution":{"observed_at":"2026-05-14T20:32:56.842198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2605.23067","last_updated":"2026-05-21T21:58:10Z","snapshot_observed_at":"2026-08-12T11:36:12.839112Z","submitted_at":"2026-05-21T21:58:10Z","title":"What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:27:50.186418Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2605.23067"},"observation_digest":"sha256:13e3692988b57b1173b344dabd86ce18f9284f6029722d68da158e916e14363e","observation_id":"1e42082f-4576-4764-aad5-8d54c9cc8168","resolution":{"observed_at":"2026-05-25T05:30:22.994671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2605.27914","last_updated":"2026-06-09T02:24:01Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T03:41:11Z","title":"Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-06-29T12:54:36.818698Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2605.27914"},"observation_digest":"sha256:cbafa327436b014fba107151cddd9e73c67c0994a7aed63a0123c1fc2367cfd4","observation_id":"22c6a36d-4935-4233-aa03-943ec5d1e208","resolution":{"observed_at":"2026-06-29T13:03:26.792263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.02507","last_updated":"2026-06-01T17:20:55Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:20:55Z","title":"Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T13:30:35.790162Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.02507"},"observation_digest":"sha256:5b6bdce530c239d0b6f8c7b22130cf03b85a323d5a6a3c32acdf31c1de4df4f4","observation_id":"ea14dfd0-dce7-47d9-b55d-7497ef599ad8","resolution":{"observed_at":"2026-07-02T00:16:24.564670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.04067","last_updated":"2026-06-02T14:28:28Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T14:28:28Z","title":"Need to Know: Contextual-Integrity-Grounded Query Rewriting for Privacy-Conscious LLM Delegation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T09:40:50.399436Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.04067"},"observation_digest":"sha256:7ef44d51f504fe6bfc231ec4f766665ff1dabf0f40daf4833ae67c2c722792b1","observation_id":"4032f613-01af-4600-a489-741470ed78d7","resolution":{"observed_at":"2026-07-02T03:46:33.041705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.09043","last_updated":"2026-06-08T05:24:15Z","snapshot_observed_at":"2026-08-02T05:26:25.857871Z","submitted_at":"2026-06-08T05:24:15Z","title":"DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T17:26:17.072017Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.09043"},"observation_digest":"sha256:5a336ac6213e80e17ca60645c0bb634650f8ce12ec8c6276aae8032c203fcde5","observation_id":"09bea10a-78fc-46fe-b2c8-d85d818fe735","resolution":{"observed_at":"2026-06-27T17:31:06.952098Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:7ac3bc0326af2453f9256124a36c4b7027ee36efc65b7c36be9668aaeec3f925","observation_id":"32514426-7f9c-451c-886b-4a473e9a9a65","resolution":{"observed_at":"2026-07-03T01:37:30.471686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.25870","last_updated":"2026-06-24T14:19:43Z","snapshot_observed_at":"2026-08-08T20:58:25.821330Z","submitted_at":"2026-06-24T14:19:43Z","title":"Evolving Quantum Error-Correcting Encodings for Molecular Simulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T20:51:06.703483Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.25870"},"observation_digest":"sha256:9bd7038e937fba0610bb7a6d31c95d9fa753030b21bec7f56ec70482e21d78eb","observation_id":"8679eeef-e7f2-41c8-9ced-4411ecc5818d","resolution":{"observed_at":"2026-07-04T20:00:08.551040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.27475","last_updated":"2026-06-25T18:52:27Z","snapshot_observed_at":"2026-08-02T12:36:42.748876Z","submitted_at":"2026-06-25T18:52:27Z","title":"Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T01:57:04.293058Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.27475"},"observation_digest":"sha256:d530c2b7805fbd8b55953a77f21ffcae8d223261f5ddd2ceadf9cb19d33ed185","observation_id":"c22fbc81-18ee-46dc-9ef2-c771530dd192","resolution":{"observed_at":"2026-07-01T18:25:58.794546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2606.30627","last_updated":"2026-06-29T17:56:03Z","snapshot_observed_at":"2026-08-03T18:44:28.040312Z","submitted_at":"2026-06-29T17:56:03Z","title":"Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:46:02.255137Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2606.30627"},"observation_digest":"sha256:9925113a2a78eb0de86080b9d8c6cc8dd292355fad06163f0a204af54a98efac","observation_id":"7821cac5-bdba-4754-a8e0-52b4daf1b66e","resolution":{"observed_at":"2026-06-30T06:54:20.999661Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-07-12T06:14:03.658427Z","title":"Skalse, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02905","last_updated":"2026-07-03T03:04:12Z","snapshot_observed_at":"2026-08-07T12:25:44.783974Z","submitted_at":"2026-07-03T03:04:12Z","title":"Pre-Strings Lectures on Artificial Intelligence","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-07-12T06:14:03.658427Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.02905"},"observation_digest":"sha256:15c546e15e2815a303c891f9f7627087cf709365f951cc72e8a4c645ff0b9f95","observation_id":"cf637c26-424e-4c29-9ebe-5b865f1c0917","resolution":{"observed_at":"2026-07-12T06:14:03.658427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-07-11T16:47:52.768236Z","title":"Defin- ing and characterizing reward gaming","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04590","last_updated":"2026-07-06T01:33:12Z","snapshot_observed_at":"2026-08-05T13:00:19.375765Z","submitted_at":"2026-07-06T01:33:12Z","title":"Attention Limited Reward Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T16:47:52.768236Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.04590"},"observation_digest":"sha256:71bcc405a8512aff08573ac7ebdd8fb1131823635ecff8bb9210d9819ab8112d","observation_id":"7a244639-b617-4414-8300-5f9c1dbf8855","resolution":{"observed_at":"2026-07-11T16:47:52.768236Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"CoRR, abs/2209.13085, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":221,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:002a6dfb7aca811ac5f7b15537f3c9f5cb4f7d2f88969c7f1a85c30605486275","observation_id":"da07dd8e-be58-4b30-a9e1-f4611eaa4a3d","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-02T08:40:57.669685Z","title":"CoRR, abs/2209.13085, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":222,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:57.669685Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:83b3acd4b0873791fe60b78f896d37c8e81645d6d53773aa373923a33c4ff9bf","observation_id":"d0538c0d-2d47-497a-a593-2441ea2cb9b6","resolution":{"observed_at":"2026-08-02T08:40:57.669685Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2607.07538","last_updated":"2026-07-15T17:21:26Z","snapshot_observed_at":"2026-08-06T09:08:13.292309Z","submitted_at":"2026-07-08T15:36:45Z","title":"Avoiding unsafe sets when training with Langevin Dynamics","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-09T07:53:56.220737Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.07538"},"observation_digest":"sha256:15c4792bf9655a78e11276530aec90b6b320912882c4e39fa6f63419df0201b0","observation_id":"41548256-8af7-4baf-b7cb-c15de7e1266b","resolution":{"observed_at":"2026-07-09T07:56:04.662971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-02T08:08:39.765022Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07538","last_updated":"2026-07-15T17:21:26Z","snapshot_observed_at":"2026-08-06T09:08:13.292309Z","submitted_at":"2026-07-08T15:36:45Z","title":"Avoiding unsafe sets when training with Langevin Dynamics","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T08:08:39.765022Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.07538"},"observation_digest":"sha256:0662006c984c61fd08a656b69ba1c6535fb3852d541f5d917ce2cdca545d431d","observation_id":"120dba60-03b8-4c6a-8184-d28a22bf8dd8","resolution":{"observed_at":"2026-08-02T08:08:39.765022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":"2209.13085","doi":"10.48550/arxiv.2209.13085","metadata_source":"pith","pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skalse, N","venue":"cs.LG","work_id":"b9869329-2719-4e51-889d-b637ee5e468d","year":2022},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T18:29:50.731038Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:ebf0cb996f0cf8ca8f7be8e5a386e3b0e98787c14705765775d3ad2791935492","observation_id":"f0b46b48-3671-4bf2-905d-ef392da95bb5","resolution":{"observed_at":"2026-07-10T18:37:31.185952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-03T00:49:48.269583Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:49:48.269583Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:7e2f7fe35d2984480d21ba77d672e2553afb30f75caedd2cb11cc67c8fa3d92d","observation_id":"dcc8c37e-1333-47c1-9749-544b090ef3f7","resolution":{"observed_at":"2026-08-03T00:49:48.269583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-07-14T17:25:37.713857Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09709","last_updated":"2026-06-23T13:47:41Z","snapshot_observed_at":"2026-08-04T12:23:53.502733Z","submitted_at":"2026-06-23T13:47:41Z","title":"The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T17:25:37.713857Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.09709"},"observation_digest":"sha256:8b7052473b635e527dc07cac154039df8eaafd91d61fcce4d224587fbebc9707","observation_id":"4c81fb80-f5b3-4e69-b005-b8eed94bb5e3","resolution":{"observed_at":"2026-07-14T17:25:37.713857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-02T07:20:42.144350Z","title":"Skalse, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-08-06T23:25:08Z","snapshot_observed_at":"2026-08-12T23:09:56.800785Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and a Group-Language Warning Signal","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:42.144350Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:7edb0af402ad2548a8fe9d8f85b2d49a2c1e680e7e4ae9d765ead6761872fbd4","observation_id":"417eb3f8-4ef7-4e8b-b103-e4dd9e84ed60","resolution":{"observed_at":"2026-08-02T07:20:42.144350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-02T07:01:21.816420Z","title":"Appeared at NeurIPS 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13083","last_updated":"2026-07-13T10:14:15Z","snapshot_observed_at":"2026-08-06T18:28:05.554022Z","submitted_at":"2026-07-13T10:14:15Z","title":"Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T07:01:21.816420Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.13083"},"observation_digest":"sha256:c3010bed0bb01031dce42cf3bd7418c83b171a6070f3c220cccaea582aaff549","observation_id":"f950cb56-c969-4987-acb1-fb549a5108ee","resolution":{"observed_at":"2026-08-02T07:01:21.816420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-01T15:04:06.730241Z","title":"Defining and characterizing reward hacking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18575","last_updated":"2026-07-20T23:16:16Z","snapshot_observed_at":"2026-08-11T15:27:23.060543Z","submitted_at":"2026-07-20T23:16:16Z","title":"RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:04:06.730241Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2607.18575"},"observation_digest":"sha256:6fbea259fa5cea367bd76868f5ccd243a7d93a3568a5b03ef83f01b5823db632","observation_id":"4ed24b25-3988-489d-90cd-1d709bb3e75f","resolution":{"observed_at":"2026-08-01T15:04:06.730241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-04T01:16:04.347683Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.347683Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:a192e4c49c6d2c13d2de04efd5597148ac20f4111ebed58d0eadd0fa758a7275","observation_id":"81b3cc78-0585-4d7a-b578-47d9d18788a3","resolution":{"observed_at":"2026-08-04T01:16:04.347683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-06T00:43:17.081550Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00981","last_updated":"2026-08-02T04:15:12Z","snapshot_observed_at":"2026-08-08T23:24:38.455242Z","submitted_at":"2026-08-02T04:15:12Z","title":"Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:17.081550Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2608.00981"},"observation_digest":"sha256:b57b18bf5c0b87977b7cd1eece346e0f28acc2fe803daf025aa4d6b36ce557aa","observation_id":"a5e3e8d5-7b9a-4294-befa-b763b83cd10f","resolution":{"observed_at":"2026-08-06T00:43:17.081550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2209.13085/citation-record","integrity":"/paper/2209.13085/integrity","json":"/paper/2209.13085/citation-record.json","paper":"/paper/2209.13085"},"outbound":[],"paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2209.13085."}