{"as_of":"2026-08-08T09:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55f403b32016f18a5cafa1e0887a7417f20d436e7058e62860733fd577af2286","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:30:35.285902Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.04075/citation-record","integrity":"/paper/2606.04075/integrity","json":"/paper/2606.04075/citation-record.json","paper":"/paper/2606.04075"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:78fd279417a7a6011e0b5acdb6f1bbcbac8a36bc37afa078b1fa3b00e8366a1a","observation_id":"9efdbd50-f087-4816-a5da-91dea8936e6c","resolution":{"observed_at":"2026-07-02T01:46:26.951300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:8399c91669444e9138edd825a5eb0e471f86d2ef3d7cef94191d1480d6b28e0b","observation_id":"54b98638-9d67-420f-afb9-6aeb6d0faf41","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:1aa19c768579aecbf2941e989163592413a62656f1bd4f4e66d2d7ef7837feeb","observation_id":"7c5a8d67-acc0-40ef-a2ec-93e5c1e1ac91","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Specification gaming: the flip side of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:e1198be6153b8b36bdf90cd11d13e4f0e6f077e280b96c31b899b8b3d31c0748","observation_id":"584b8cfb-ef6e-4f39-a031-7560d8c3f61d","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:afdeda748bbd58b6daff5c4b478ee946b631129182c24720e54f81a08d3fce80","observation_id":"f8a451c3-6c4c-4b86-8401-3be7115aae5e","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:95fe3243b213c6f0b1506fcf4371ffb45aeafc8ef21712f313cea7260116786e","observation_id":"ffb2b9c2-dc12-4877-85fd-c94abdde8eb9","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:4fb002e0a5f8c7532b246a0234887849446e4b37e7421033cb63693200391f5d","observation_id":"a22189c9-f4c2-4e04-abb8-56a805d470f9","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Constitutional","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:d5f1ad67fd2287207a0cb9ecf96ed5c5642b8aafad9b4ca9678e7f9648eb50da","observation_id":"c85e5c66-30a2-43f7-abe0-e5797eb5a412","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:aff6312b4b8458f16f7e718ee15b6091bc02e137c01f23a3936823b62b2681d0","observation_id":"5afb8ea0-e3b8-48da-8dd8-a819b67635f0","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:1f70cb58915a3df70cf9a84f630cb80b8bf0202fdd03cb6ff447f0edfb5754ea","observation_id":"8eea5c98-e98e-447e-8471-a3d9a23c1c4c","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":"2209.07858","doi":"10.1136/bcr-2013-201554","metadata_source":"pith","pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","venue":"cs.CL","work_id":"1aabd84d-3779-4ba9-ba2f-15ce264a9b1e","year":2022},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5bb7515a929662ee513256601a9c41d612e5908f53186032ff6754e08b473a2b","observation_id":"6a023afe-25e1-47b6-989f-e0237c8e63be","resolution":{"observed_at":"2026-07-02T01:46:26.954082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:aa0cd7fa00fb1ac65dd314628a0c69ffa73eab4bda161d8a339065983a60edff","observation_id":"6546ecd0-79b7-457b-8cb9-68acc82e76e3","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Efficient memory management for large language model serving with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5eee8d61dd996dd0818b54a4ac8854031567e001230f56b87e9e7d302de30d9c","observation_id":"1e62de06-0edc-4f60-866c-1d25240d7d1f","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Artificial Intelligence and Law , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:10a192b6e78a1d6b1e1332ac228f44a81281077eaaf0342b9376de7cccbfffcf","observation_id":"8cc6291f-ad3a-456a-9a5d-0e34b35ed174","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:dc9991245f1264dcb79d31f82896429e6637822b496e0d5ff4b62d1d69d48c3d","observation_id":"41dcb44f-03ae-4f4f-a95f-0e0edbacdee8","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Artificial Life , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5347d3ce19885b6cf5eaf352be0df12fe7611ee8659265da1af4494c23f41099","observation_id":"5a45b5d8-65b1-432d-9b0d-25da7a571b89","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Categorizing variants of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:cfe9d29ddc9ad0a452a2ab1fad81c1d7d119e7004e6a8ff251c18efa3c9c7b91","observation_id":"8dbdf55d-109e-4ade-a36c-a1a34b1c19ee","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:7af2d37150d8228c1a2a60ef65816afa889b4a866e33fd4d4fff639e9b515073","observation_id":"16b4e23d-d159-438f-a465-a7cd95822a0c","resolution":{"observed_at":"2026-07-02T01:46:27.020310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:1ff1313fe780a064ce11022e9398abcb8aec1a73b0318f903ebec8ebf653d1ca","observation_id":"6e94129f-99c1-43dc-b5eb-4819b7e238ba","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:aeb49e0c6f0cbccd257ce92d94685c380ef0411fb622839cde0ca75112dfd484","observation_id":"8357985a-befe-4cf5-acfb-d58ffb1a555b","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Joint European conference on machine learning and knowledge discovery in databases , pages=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:ce580a9c4be34bede12665d6fd879eb02bbbc82a7bb30333027ad5f420281489","observation_id":"066e16c3-29bb-4dd0-8ef1-cdb84634eff6","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"2008 , publisher=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:929597bab9a744c39852d6d6a9d9bbd1efbf3972ce1921afd397d2440451a13d","observation_id":"cb0636b4-d0cc-44f8-a2db-478e03d02a7e","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Journal of Banking & Finance , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:9da8a91310ce3f2aa1b7a62717bc495c0ba32348e0a6df2f7426870cc742880d","observation_id":"22b9cc5d-0635-44cf-be67-8fbffd195530","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"2017 ieee symposium on security and privacy (sp) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:365c1ea6f589e5a74e429582f38fd77640b3178bd43cb667ef62e841c841d517","observation_id":"eb146931-4c8a-43ee-b05e-707bc7ad60bf","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Proceedings of the national academy of sciences , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:b168b7a26132a342d1f842bb526aac3aa56c5b6bd9fb066fb64c4658928ec997","observation_id":"0d3cb87f-dd97-4014-be20-5b22bb76bcb9","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"The Quarterly Journal of Economics , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:7cf20119b928925bc32f4c6cbd7eb11c767565f953ae63a00ce15f83cea8a00d","observation_id":"c92f32e6-971b-4d1f-aae4-fcea7f15585d","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"2011 , publisher=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5a2e2e76af600358bb935416081ab8f622d9757a6a473938050d4b822c44b355","observation_id":"75ae0e75-9a6e-4d43-b03d-2a1de4c82b93","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:8186b7522f982fd05b313307568ea197ac4a38e519ab8b767a755755ee306afa","observation_id":"854eab67-52f8-4ce1-91d1-788c5cf33e5f","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5c10a3ffcdc21dc4b3281375742e18f222acf6b8463eb07350e4fd204bfa13c2","observation_id":"b8a62c8c-423f-431f-a4dd-870060063d99","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"International conference on foundations of software technology and theoretical computer science , pages=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5a4bef0c7a7952489513c198dcb9fc5ae5332a5e1b886b82231a3f629a1271d0","observation_id":"19c1af63-037c-46cf-9f48-b89d7de7acef","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:4c964da8c5104e159702f16e4a46c8d4af8221933539008683933d0aa71c05ca","observation_id":"5bcc912b-3254-4736-9c87-7b21ff450b35","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"ACM Computing Surveys (CSUR) , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:2c8e77ced37eb03a2ee3c2fed48e7c585a0d72589afa328635add6d2f89af188","observation_id":"8a1ae977-4cf2-433a-9b2a-32ce414c877e","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:5f10297136787d6b57304ca3f6bff697ef61e029471189cfbbc1b7c6774ab7b6","observation_id":"c70e1219-0983-4038-8c46-e39919b6a405","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20138","last_updated":"2025-06-03T05:45:06Z","snapshot_observed_at":"2026-07-06T20:14:03.824268Z","submitted_at":"2024-12-28T12:54:06Z","title":"TradingAgents: Multi-Agents LLM Financial Trading Framework","version":7},"cited_work":{"arxiv_id":"2412.20138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20138","snapshot_observed_at":"2026-07-04T20:00:07.722366Z","title":"Hongyang Yang, Xiao-Yang Liu, and Christina Dan Wang","venue":null,"work_id":"e792c1b3-342a-4de2-98eb-fa551be974af","year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2412.20138","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:d9e282246a1a6642873f5cbe461b0209cbd2140b640cc34b510a9a07d5194de9","observation_id":"67f54172-0119-4fef-8d09-c76d2c08939a","resolution":{"observed_at":"2026-07-02T01:46:27.003033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:110694517051271a944a1b5624d55480860e6b062d613342f174e51930080017","observation_id":"ba3d1739-5bfe-48e8-a4e8-57442e83be39","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Political Analysis , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:e16931c448f4685113172e38261022ac21f3c80401f0e9627ec6f22aeadb9898","observation_id":"c0b76931-b613-41f8-a053-5128de6b9ac5","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08691","last_updated":"2026-04-10T15:11:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-12T15:27:07Z","title":"AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society","version":2},"cited_work":{"arxiv_id":"2502.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08691","snapshot_observed_at":"2026-07-08T17:35:09.833227Z","title":"AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society","venue":"cs.SI","work_id":"293ae4a1-dd38-4778-93be-14914c1f0643","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2502.08691","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:3d285ea4d98ccb07da925a7562a24f2aa5605c650b90d09a947acefd1ec2c090","observation_id":"1ad8bde6-bf97-4eda-b8fc-2c3f85f9c586","resolution":{"observed_at":"2026-07-02T01:46:27.006925Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:b69140c2379f5510d4ec7bf566a9d70e0810da61708ad508e7abf282c90a2e49","observation_id":"cb9b8cd8-ff78-489a-b0f7-9da875eb5642","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Science Advances , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:325659e77c5bb248a4737fffd3b6de7630232f21ed471f1fbda14928f75d585c","observation_id":"5d17cf83-4421-420e-86b0-585a22b214fc","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04246","last_updated":"2023-01-10T23:42:30Z","snapshot_observed_at":"2026-08-05T01:34:42.166989Z","submitted_at":"2023-01-10T23:42:30Z","title":"Generative Language Models and Automated Influence Operations: Emerging Threats and Potential Mitigations","version":1},"cited_work":{"arxiv_id":"2301.04246","doi":"10.48550/arxiv.2301.04246","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.04246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Sastry, G., Musser, M., DiResta, R., Gentzel, M., & Katerina Sedova","venue":"arXiv (Cornell University)","work_id":"b2715c0f-e691-480a-8037-9a5e8b8ba009","year":2023},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2301.04246","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:49582b9efca4879554279d8716cc77649b57f0dbe5e3a7787ee3495a6f7aa2c7","observation_id":"255e9924-10d8-406f-8d6c-6455072278fa","resolution":{"observed_at":"2026-07-02T01:46:27.015636Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09523","last_updated":"2024-11-14T15:40:04Z","snapshot_observed_at":"2026-08-05T11:33:06.319013Z","submitted_at":"2024-11-14T15:40:04Z","title":"Navigating the Risks: A Survey of Security, Privacy, and Ethics Threats in LLM-Based Agents","version":1},"cited_work":{"arxiv_id":"2411.09523","doi":"10.48550/arxiv.2411.09523","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09523","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Navigating the risks: A survey of security, privacy, and ethics threats in llm-based agents","venue":"arXiv (Cornell University)","work_id":"25f787e9-0cb0-484e-b623-05046c78f166","year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2411.09523","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:453e5a4ab00239f7bc57ba9db48d2672f2d723854daf2fb1c9c84a1d3b694b9f","observation_id":"2e361583-db4b-4110-8795-6bf517c122d8","resolution":{"observed_at":"2026-07-02T01:46:27.010929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:6cd3527be1f8e21475f0eee898bc09ffa524f09c56b3134d173ae677c8f438da","observation_id":"9e33b3c3-f666-429f-b3a8-0f14e9ecc732","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:f99d099ad001cd5efc9fe03384d17e68c916a6ed679502b73f4e807abaf8a1da","observation_id":"9ee9eaa9-831d-41c4-8411-ffeff97c5c48","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Public Administration Review , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:00902a6b2fb54061fcc121a82f5b8a1141bb5e687f376404776e16639b98850b","observation_id":"01738f1b-68fc-4a16-b4e5-74b2db40a2ce","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"American sociological review , volume=","venue":null,"work_id":null,"year":1936},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:55276e325d439535b7b7f23f2805c5875349231e46c17b145cf34584ce1273e5","observation_id":"1b310ca2-d417-4290-a21d-3ddaeb7c9b1e","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"New York: Russell Sage Foundation , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:8a795dc6e3e969c1bdc33e8fb39a9f5a2483d934ca2077ffe2c8f4b7236c9d5b","observation_id":"f87a040c-ddc9-495d-9ef1-53b93b73626d","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"short-termism","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:d650edc88e965c31d4c0f75a9c8dd349119f2351ef197abbb4497820077353f1","observation_id":"02022335-1413-419c-9494-6bb26874e09a","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Monetary theory and practice: The UK experience , pages=","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:2c05ca75977e0e00603668dac9ee6ab45dfac5d5a06ac31ae3687ffd62e03561","observation_id":"4f82fd7d-0e14-4daf-b20b-0b5ac41f2e5d","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":"2309.00267","doi":"10.48550/arxiv.2309.00267","metadata_source":"pith","pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","venue":"cs.CL","work_id":"81d8781d-2933-4e89-97ee-9bbfc6d4ca0c","year":2023},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:fcc295adde11793f1f1f0d9101b02503b196c739a7ecdd9331b12e8a5f3cd89f","observation_id":"5e52f5f1-3b63-4760-8fe1-e88529dc5060","resolution":{"observed_at":"2026-07-02T01:46:27.024786Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:a06a39d624c8587a49837ec15a40c52296845d9cf021c98f2c07142589e837d2","observation_id":"73bf1c18-c609-4837-87ed-c7dfba1e7e44","resolution":{"observed_at":"2026-07-02T01:46:27.033328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:829f2f6176fada8e05bc8466e5526f75f351b97ca2888240803f526c391c29bb","observation_id":"eb18a35c-3c6f-4fad-8258-7d320d3709c0","resolution":{"observed_at":"2026-07-02T01:46:26.988139Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":"2310.03716","doi":"10.48550/arxiv.2310.03716","metadata_source":"pith","pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A long way to go: Investigating length correlations in rlhf","venue":"cs.CL","work_id":"23d0dfe6-c919-4498-8696-1e298c7834e9","year":2023},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:108ff91c87ef29d76a38a6e4f10e8ecd89e52043d53907097f412e833e51ab01","observation_id":"8624b820-36b4-4fcf-8606-1021e9b205ae","resolution":{"observed_at":"2026-07-02T01:46:26.991887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:d4149630f84620f9c984ca98655ec79dbcf200a63b04019718b82d4ca57ae1c6","observation_id":"fc16fbca-74f8-41dc-90dd-e3b490d9c523","resolution":{"observed_at":"2026-07-02T01:46:26.998730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18397","doi":"10.48550/arxiv.2511.18397","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural Emergent Misalignment from Reward Hacking in Production RL","venue":"arXiv (Cornell University)","work_id":"7ffab50f-285e-4804-b3fe-167071264d7d","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:be632ba46538dd93e86f78831b7bbb035637d1ed16e554cb0185a675941deef7","observation_id":"a821e81f-971b-4b59-8eea-821bd0920e4d","resolution":{"observed_at":"2026-07-02T01:46:26.977064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:8883278d875f12590e973f0f9e0c452407a7775e5b6fe566e0b653b269c7a39d","observation_id":"8e531e21-b025-4d4f-b37c-bb78efe65315","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:c34436313c7078cf1a450308bb216157061457c85dec0a7cedbacae6a2a94dc5","observation_id":"275e842f-49d1-46a3-9022-42411fff8769","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16175","last_updated":"2026-02-05T18:03:03Z","snapshot_observed_at":"2026-08-01T10:41:29.420510Z","submitted_at":"2026-01-22T18:24:00Z","title":"Learning to Discover at Test Time","version":2},"cited_work":{"arxiv_id":"2601.16175","doi":"10.18653/v1/2025.findings-emnlp.691","metadata_source":"pith","pith_arxiv_id":"2601.16175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Discover at Test Time","venue":"cs.LG","work_id":"e6d32375-24bd-4c3a-a7b8-fe20121f31b1","year":2026},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2601.16175","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:ea43043de8b16d54f45e21e62e3295f8107239b3625b5198a9de7209f3e79457","observation_id":"e47899e1-f552-4569-9203-bb1ba7c8a990","resolution":{"observed_at":"2026-07-02T01:46:26.983990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:79968579cf012655a872a470b8c9d8b8030ac0f1eaa0a9dfbed22020b0a7b7be","observation_id":"f84771c3-3d0f-43a8-be0f-38c68c4f85f2","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2404.00806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:36:55.312040Z","title":"Algorithmic Collusion by Large Language Models","venue":null,"work_id":"a757a8fd-d1cf-4973-bc9e-8b0a2b4550fd","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:4c2aff8d081c767c66f47df880f937264be7b644f03ae5f321b508a37921ed59","observation_id":"dcce7423-9742-4dff-ab3d-f34fc17c9a39","resolution":{"observed_at":"2026-07-02T01:46:26.995173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17339","last_updated":"2025-03-21T17:40:06Z","snapshot_observed_at":"2026-08-07T16:45:53.413677Z","submitted_at":"2025-03-21T17:40:06Z","title":"Can AI expose tax loopholes? Towards a new generation of legal policy assistants","version":1},"cited_work":{"arxiv_id":"2503.17339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17339","snapshot_observed_at":"2026-07-02T01:46:26.978583Z","title":"arXiv preprint arXiv:2503.17339 , year=","venue":null,"work_id":"b4d6c290-746e-419f-b8ab-fbc850b7584c","year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2503.17339","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:4e8b2bc09c8bf01007a6eb10a2d10fce6c91af187c2096293f2b2f64054f5fd1","observation_id":"09ea372e-6966-4b61-88c7-46ddd4e38b8c","resolution":{"observed_at":"2026-07-02T01:46:26.980528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.20281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:46:27.027064Z","title":"arXiv preprint arXiv:2603.20281 , year=","venue":null,"work_id":"2992f1b1-00f0-46f0-adfb-c87378e288ec","year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:aa219c9c6166f803a50a623e6abd102e5922bafc40d362b78acb231ac1cffde0","observation_id":"a92c3ba6-6776-40c3-bb1e-8971b9910b20","resolution":{"observed_at":"2026-07-02T01:46:27.029572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:aeb0df3e71294a432f18b37412cefaa2a48fa2436a785bf55d7822ddf764fc02","observation_id":"3236340e-b708-4bf3-a947-2e2b2deb9d45","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.08068","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:46:26.964570Z","title":"arXiv preprint arXiv:2507.08068 , year=","venue":null,"work_id":"f3603cc0-cdab-45d7-9ed7-f7777931311b","year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:fb9f4e3823c42f0e13d85dc71add647911f3c2fccfaf2c42d01485e64e7a7e6f","observation_id":"b36843a0-d119-4598-84e5-d47493a012c9","resolution":{"observed_at":"2026-07-02T01:46:26.966168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:77c137ef8c0bb04942ea965df2bab72338b5a748ff535b4555ce06704c89f709","observation_id":"8e7d8c9d-acb6-4c4f-8d97-58ddd8ac2d83","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:33f70b81890323e9f0abc227ed6e542288526865ae370d9d695957c2a80e0c14","observation_id":"5b67b3ce-bc6b-4faf-977d-e3fb44c47ec3","resolution":{"observed_at":"2026-07-02T01:46:26.970140Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:d29e693441a2d0d969fb6c835c0cae2c9f665bb6077c2ac1ab6d40f7aa442da3","observation_id":"fca1f5f6-26be-4f95-bc46-a5bbed9aab11","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":", title =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:2c4bdaa2d4017ae0e7e6cac281d9dc2043e8dbad696933eb9038393eb7cc15b1","observation_id":"0b01f78f-a34b-41a9-9a90-6ab7e0a4249e","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:e85a5ec3b86839bcbb107d988c18356fae7f4d625096b81c77495e8c5c81c1d3","observation_id":"0e2c5db9-676d-4e0e-b5b7-1995683c2eb2","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:e6ae1fd772683f9953ebaa572c8378f3f93be166a74c37e703e3eab7022c1a82","observation_id":"3d768157-7af4-4210-83a6-6e629150c6ed","resolution":{"observed_at":"2026-07-02T01:46:26.973660Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"Richard and Koch, Gary G","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:2c94a85b88c649e6d18cebe29dac6323eb58c559190236b7a11fcb5a0af2281b","observation_id":"ef2fee43-d1f8-4bcb-9dcd-b053df353693","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.17424","doi":"10.48550/arxiv.2502.17424","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Misalignment : Narrow finetuning can produce broadly misaligned LLMs , May 2025","venue":"arXiv (Cornell University)","work_id":"27d5f019-1fc8-47e4-bc86-3f09a2569685","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:1fc75ad0cb0640b25dac199722ad3c4cdcd47cdb7fe06cbe4171bd246f8463f7","observation_id":"4a0a8b9f-ffdd-4448-9cb7-15f7a2fce038","resolution":{"observed_at":"2026-07-02T01:46:26.958324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:19.46989+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:19.46989+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:ad68ca11e363698071f7a4f852e0b650218bf1a2e9962f80a049bb89795e21e7","observation_id":"9a77f0fc-8f8c-492d-bf1f-8786a37c02b3","resolution":{"observed_at":"2026-07-02T01:46:26.962571Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:c12f5ad5d8535169b06a461fa5cc78f9eb39d11bb5c23b54772e2779bd01d66f","observation_id":"0eee1109-9cca-4592-a37b-6bb32e06bce9","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:a368944e8c5755c1bb95875b24dd2957df13f3713e2fd95efeee2906c41ae0f0","observation_id":"d1d78bf0-6b90-4310-9ad1-40dff0108329","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:30:35.285902Z","title":"The International Conference on Learning Representations (ICLR) Blog Post Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T11:30:35.285902Z"},"links":{"citing_paper":"/paper/2606.04075"},"observation_digest":"sha256:45353d9b0233ca4da6ebef79c68f6f9456312964a05fe8cddcff090d9510f938","observation_id":"3e9f0df3-28c3-40e4-8bf1-0ef793de5762","resolution":{"observed_at":"2026-06-28T11:30:35.285902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.04075","last_updated":"2026-06-18T13:14:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T22:57:00.184818Z","submitted_at":"2026-06-02T16:29:48Z","title":"Large Language Models Hack Rewards, and Society"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":18,"parse_uncertain":0,"unresolved":53,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2606.04075."}