{"as_of":"2026-08-14T03:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d53fc4319adad46b0222e6273f90d8ffc4947e7ed0c794cc5ae7ab29cbb0f28","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T10:37:39.719847Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.04237/citation-record","integrity":"/paper/2604.04237/integrity","json":"/paper/2604.04237/citation-record.json","paper":"/paper/2604.04237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:6e7d3e1d64eb1ec9d3abcd11996e55d88a192416b8aa0a7075e3f825bbf963b8","observation_id":"40ce4411-dd40-41ac-b4df-e315310c104d","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Hostetter, J.W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:2301875307aec7c5b97898f9c6318ef562ca6c5ca2dc70840006072a14c51157","observation_id":"bf7b6815-5323-4bee-a3e3-aa3271b4bc8b","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Held, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:f93db929785815fef1f3eac4016db99903f53c441f12b119e4a668393a7fca00","observation_id":"1c97b2d0-899b-42ca-b599-e410782cc893","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Fazeli, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:df1b0b68af68f783b67845e0549ef5eac353d9a384b40ab4340f0aa8151d6231","observation_id":"29823a9e-f0ff-4227-b4f5-6a79b7472b38","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:f0a0cc60153dd97f2363dcb5f102ff4ffdb01d2cdf2f7e62e4b58ce087269721","observation_id":"7d18bbdd-b03a-4e01-af64-b320989a3f56","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Olah, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:bfb79b6360c780cf3391daa053655c5c6f67584e730e7743a452c963bef5dccc","observation_id":"beb88147-301b-40d5-935b-5c50bdd0f39e","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Corbett, A.T","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:f0c19ef74cc4f6936414582fc351dd053d0726b908427fd6c3bd762d03d75aa4","observation_id":"a89e3796-5ad1-46fd-9f3e-3eebb906cfc0","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Krathwohl, D.R","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:5dd77a12b781d001bf379d6c3c1e3df460f85db7bf26b2897ad0c8fa4cb1e836","observation_id":"4310bc6b-a66e-4226-a659-b37f8772d567","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Corbett, A.T","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:1b183e2e40d50cccc1fcbdaa6c2e1e86aff132f920ea18f902f139a7ba975a0a","observation_id":"e3861d88-9779-40a3-b54f-2b624855c054","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Corbett, A.T","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:89e6738c3d8c6d18f78ee2e6008703bd40133591ca7131d003e1906db98137a4","observation_id":"70273c54-9e71-4ece-9b82-126d49b1f45a","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Corbett, A.T","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:8ee9c47d67f5861034d870039488dfccae28591dab608007b63ca6b3ebd25259","observation_id":"093c9473-99a1-48c2-b773-c07682ef2255","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author D'Mello, S.K","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a883dfe25c29f59833a11d1909df1649293ba78cab43cea0b8f8960e095ae4a1","observation_id":"9f58c92e-3c58-4cc4-a528-91ff57b84dce","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Hawn, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:b1357b3f99eeea29654db8eaa443438dd4abe6e4910059c5ede1d2096c7aeaed","observation_id":"a661adf8-4519-4e5b-bdbc-365e88a2b1ac","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Woolf, B.P","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:b81a30bfee65aa991cea5883e6dba313d31ed9e8bda745f77aab207579102134","observation_id":"e37989a0-fbd2-47cd-a66c-03e2f9f46cb8","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1984","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:883d5b72d0c84917788ad54b557ef19023b0d1c90eddcf9e78e7eb733247eba4","observation_id":"ab24a9bf-af5a-414a-b647-3a2d16efaa3e","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Wylie, R","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:54200a1b96ab50c0530b2bf1a28725ee62496ac3e1873df587671ed4e6b1e35d","observation_id":"e5330711-0d08-4931-a069-0acc578ac256","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Leike, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:97f4cc7383fe6de602b62d3827d62094ca639eefc68e056ddcf49aa970c45d34","observation_id":"318bf2ff-7c18-427f-91ce-6676dd1397e9","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Roy, D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:182657c55906c2577c49cb2b7a7e2de71159c8667455b38f8f08402d98b02507","observation_id":"6afe64e1-d35b-43f3-93ee-9c714b8df478","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a9cac67c92c07c9a448bc9ec717f231178d1a1cf39862730849a630139506dc6","observation_id":"36541357-8847-47f5-830c-1324558e10fe","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Anderson, J.R","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:b655212cb5f958fc3e8831c4965bdfd2af02ebb1a48816242f16eb8437b6f2f1","observation_id":"b14ee215-6cce-4ebd-8d7b-da1adb7d2940","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Dvijotham, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:5f35fd5ca940b99e9dc9e9d64a6f0652ec8f7bb6fcf6be581c5eb28fc717d5dd","observation_id":"0df90e53-46af-4820-8ad4-57c5c152bb10","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Koestner, R","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:15b57c538c109d138b55c948e2df362ec0d8d181e3e1958d7b15ac69d8b376c6","observation_id":"e36e242d-a1f1-4f89-b6df-3dc32c952020","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Graesser, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:90e8d63a9aae6afdae2082cf5b9c8f43ce5471e540e2d17a36cde9eeeb2135c8","observation_id":"a0b0a3ed-429f-45ba-8539-35cdf40ca9ce","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Aleven, V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:030b373c733dfa9342b78c72a745ffb8a9c8e91a5c1f3124754aa765edc2cd13","observation_id":"409f4ac6-92cf-4c3a-9317-9cdff90a5c09","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Skalse, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a5f6d752e0249c768c5699150224b2c89049df11f60ac226a1c1c818effcbc21","observation_id":"2fc8c0f6-865f-4505-82a2-67754d8d0c58","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Blumenfeld, P.C","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:437a4e50455805644f57bd134a255d5c600f07fcfa4b80f92fd50ce58a1de483","observation_id":"7c3b945f-1423-4839-accd-40e24e191850","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", et al., year 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:824af18b68e65592cc04bcfddd36e3bce99e3e62b19d6b8738fab25165a98e09","observation_id":"d36d7c72-501c-4819-9880-c757c0608499","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Fern \\'a ndez, F","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:17066783be7b378fc6a350a1a4be076c6a3258f6cea4f65d3795e3b61f0e66a7","observation_id":"5577933d-b3b2-4c2e-870d-e415aa6e0733","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1984","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:e4bd84286fa6c71322fae289d41c6f31ba05f09b549205fdadd47e4ddfa227ba","observation_id":"77bd082a-d9a4-4ef3-a765-020dd8ec057f","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Lu, S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:da59a1703ba8486abf123c696f6de8abdee8d23099e6e8a181b5032ba225efd0","observation_id":"72aee1ec-49b5-4eab-8b52-6afe0bcc686a","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:4e36f61537959ab66bb88d3977541c0050333f126a8a02c7328979de24b944cb","observation_id":"3fbdc9cc-0036-4a49-8f90-65c78d1d27eb","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Muthukrishna, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:528ff905dd4ffc14c3b4ff57748d513b57f48b0d54c77d3a8cbe137098c71a9b","observation_id":"627646d9-3a16-478f-ae4a-90ae3bab464a","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":"a llstr \\","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:03672725f98c1bb97256077e6e8aaa168a7110c75c21a92177e64d0b890e32b2","observation_id":"49551fca-5b30-4adb-9de6-be9135f44b64","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Heffernan, C.L","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:139ae08bec0078064e02cc0e9bc818107cb086a18abdb32eac690471bd932384","observation_id":"f4588a95-0c03-49da-b2ec-71ab56404821","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Porayska-Pomsta, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:fc768846533bb713291b826e8c7d53d74966e0c22e86c449f4b7bf6019a6c65a","observation_id":"8a849791-d96f-4588-8f90-2b0b549d6ce5","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Wortman Vaughan, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:7557598c1eb72cf5fc1389be998228ab69c4336b054fb7136c3d9627393c53f4","observation_id":"d0f97767-a952-4bbe-ab22-7679550f7d17","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", et al., year 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a9caa8e770636ee9638552b421f3d4d48f603fc70ae6d84b1a10b3953e81dc91","observation_id":"3a3e2419-d20e-4273-b1ff-8ace4dbc054f","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Mart \\' nez, P","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:0847915d4b5a825e5173a4758345589ef934f07bb51285937c5ac3efa614940f","observation_id":"eabe6261-a691-4b33-88da-1024e022b1bf","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Yang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:d47131e3b731702642ec80d89d9395127988efa1f767850d28367a5d4865893a","observation_id":"a6d10bef-73c2-4556-80fd-894e1935e1c5","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":"u chemann, S. , author Bannert, M. , author Dementieva, D. , author Fischer, F. , author Gasser, U. , author Groh, G. , author G \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:ed1f0adbef522d503f945fefeffb123d16a0d902b19dc0451b8f40ea63f5792c","observation_id":"972cbfe0-e413-49ba-ac3b-0b2076309cab","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Brunskill, E","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:d9b7b152defcd45bf69f2ee84d5c7756d6bd4434cb0ae8797c3aceebb9f42c57","observation_id":"352bf568-0d82-4517-9844-ca07da039b0d","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Uesato, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a666949f4b81d04f6108ecafb46325a5f293a83440b4ca05620fa9036d006d9d","observation_id":"2457f59b-54cf-4da2-9b07-4d3adaffa2f1","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Fletcher, J.D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:586b5b44680bff71199323ac86087fcca6fdad87ec0947785d16d8662fdd4963","observation_id":"003bc79c-5e21-4224-8501-fd85569a91b2","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17342","last_updated":"2026-04-29T10:07:30Z","snapshot_observed_at":"2026-07-06T21:28:57.440918Z","submitted_at":"2025-05-22T23:26:12Z","title":"A Survey of Safe Reinforcement Learning and Constrained MDPs: A Technical Survey on Single-Agent and Multi-Agent Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17342","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", et al., year 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/2505.17342","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:9a9cacab0cce491a5eb56b66f380cdd1215b467e684f26d3f8aebf26fb31bd1c","observation_id":"4de42525-53e3-432a-87c6-93bd7eca7914","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Krueger, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:3c1252c066dbe516fd0dbb51512b41fc52958cdc7ed51d7f53eae9b8b648ce66","observation_id":"6f694e5f-4080-4fd4-a56e-e8d684ac58a4","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:0fd099ac5c59c7b5078062f853eca691b477d6e74e972bd1c6a0fa304346441f","observation_id":"f635b969-de24-45ad-813d-20ad0b299933","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Harpstead, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:3bde22a4c31a41173ef0c3a87993f638aaa8e9f707b3a2813d1adbf6cbd5eb44","observation_id":"cddea6ca-a817-402e-afd9-6a7ab18346db","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Liu, Y.E","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:3319980470115e41c20d368865e734f3c91d4b03acc70bad432ebc66c940eadf","observation_id":"e3e65764-15c2-4520-bc12-ffc14349bc60","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04585","last_updated":"2019-02-24T08:12:46Z","snapshot_observed_at":"2026-07-06T06:27:55.499625Z","submitted_at":"2018-03-13T01:15:39Z","title":"Categorizing Variants of Goodhart's Law","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04585","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Garrabrant, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1803.04585","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:213beeb87a07113c0a2bb2ae134c1a070255888fc0844636fb0053f9a5e86ff8","observation_id":"5e9e9439-824f-4283-9413-b771e78885e0","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Kochmar, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:1ee9c7c1ae09b85eff95f733c760e820f4b3f358d2416708d07cbb925c4627f2","observation_id":"62581fe4-3073-4dd9-9a3b-97a28ea022c0","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Reuel, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:4418dbdd60a1ad780c6986c7b30f84dd17e8e1b9e559c8a43c12825f8de91e27","observation_id":"a30b6491-4a57-470c-91ec-61d3a82b3023","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", et al., year 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:f73d6d1988b70b590e8ba23d2ef50d5553e7257dc9dea91af288002d0ae7dd45","observation_id":"2284b373-70b8-4eb9-bd8c-303e917ad204","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1990","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:8bd574b89e9a280e04256a8c3ffc95de4da7a65a245e449f3140d307ea39d931","observation_id":"9f3feb5e-d990-443f-a6d9-79580d8ad5c6","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Wu, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:7c1bc885b9724703221f57787f73e35eee6a7d821b868a8e41490850bd06deb9","observation_id":"872a174c-c94a-411d-937a-a6311285c6c1","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-13T04:40:05.019883Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Bhatia, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:92b66a2f703ddf6f108d7822334f6043edf17e9ab0fe141d879ee1261dd44d1b","observation_id":"38194d39-a07f-4490-9939-457cc00af421","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Jones, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:1e2ec049531653a3959d33fc3fbf215ca39a95e6d2b1ea9726e038beda9f39a8","observation_id":"fe2aa1b6-14b1-455c-a9c3-87b94b054ad6","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Cen, H","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:230b384b63e21a27ea804770724147a14d925061dbbe5cfb1352b8c65359cf86","observation_id":"9be1de51-d088-4b2d-8a2d-7e3dc2291e4f","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Bassen, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:9e3a06e11079df6d12a95a461c2f552b0499baa77148af284759b7b385def094","observation_id":"3a6f4e8b-fae2-4748-9bd2-26aed9b8fb84","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Brunskill, E","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:84082c5622a56d50a6f40c284bcdbe992845e74c629e39a2678d129d7bde850f","observation_id":"85e89902-b83e-40b7-87e0-86b0a5b358d3","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Achiam, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:c0584df13bb4d17fcb431cf15d45237dc5a00dcc198f9d1787107ee33e604718","observation_id":"59f7449d-b563-4ec3-86cf-cffb7c9d3c12","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Vamplew, P","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:497f5175b245873b3b34f8683140779419e53f9f0881d923252c7fbc38a8369d","observation_id":"05d13109-53bf-4484-baf3-52f9ebfbfdb2","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:161dab8c53845861f29882bf6101a85d749cc2540c7f9bd62e3d7f9117368a6b","observation_id":"66c14b41-d1e8-49f2-8d95-b931dbd07a07","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Abdelshiheed, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:3b0b1cb2714b5454d5ce8b9c00d3af03cd16789a8063f14fd25820fd49f8a3e8","observation_id":"d355fd72-03a0-4c78-ad06-28b6948d2780","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Maniktala, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:d70ba9d77e2e142f11652bff900d3d39d296a3bf51b37e460c8f3b08ee3034bb","observation_id":"4758e1c1-25f0-4db3-b908-e124141b6a39","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", et al., year 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:6500d8fbe38f0f2d3f1d59ae9f78c0d9f7075c22d9c059fae86495efc011d11b","observation_id":"c47e2ce0-dd1e-4c4f-a98d-9d6dde1602c7","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Howe, N.H.R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:c625953568ae49ca6bfba2e5383f4af9fb16afabdf8210e14ce6d30cf18c3a49","observation_id":"924c8457-f61d-475e-a6bf-a20dc431ea7e","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Cooper, H","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:e5e47211546210bd348acaf6461f6fc29d3ebe3f34a51b03865cad06ea901282","observation_id":"430f68f8-bab7-48b4-a99f-1c083fe61d6c","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Barto, A.G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:7b075750fe421f43af99a6af1b211b4687a73d77dde605dd186debe41e33cae5","observation_id":"d02d38a7-6bda-46b9-af6d-d25059dd0a97","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Mankowitz, D.J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:9f9b0311f3b199a51d4464446ae2f8fa011e9ece87bfab07e285211e89ad4f1d","observation_id":"7632cf0b-af06-44db-b7e0-dad4569fd3fd","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:73ac5037a2df15278a00aecdcc0fe6950cd53ed8e80db882aa528e4c05cb9c44","observation_id":"79dea177-55d9-4601-aa0e-5868b5c6b910","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:3517ca024cceb2dd5f133febfa045f8173d2434d51b0e18d2e47b46b9984d9f1","observation_id":"4e595aa0-915a-4158-8b8c-81a109a4d310","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:0bff37605607bd25ea1e2282408db0edbd633014955d330f23dd0903f5ce0073","observation_id":"d84c7e89-7b18-4ff8-9b75-0f86a3fa6165","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Sui, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:1817cb9dcc858254bcc597c58408e38de8a30e91162d29a056cd225634993584","observation_id":"4756ffd4-44e7-426b-8f88-dd05be76e795","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:cf1701ee60d0edf056f344dd3b5647599aff13eec2fcc86720ef7958d6806a30","observation_id":"dc6c0429-e7e7-4647-ae4b-84ee450a3a12","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:ab9a67c4a2e793712a31b0f5f16b2a87ec8d7073c1e8eb978db2f0b6a97c7f99","observation_id":"37bc3a80-1658-432d-bb81-86d5f2ca0016","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", year 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:5d016e0d656370f2240ea3cdf9b510b12a7440ebc7f42de6d2c691abba87af20","observation_id":"b3b7f8e2-f38b-4985-b543-1c8ef20a4166","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Sha, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:dec8c7a2fc487156c99938fc760c522079e5dbbe53df6ce45a9a4d664f2a993b","observation_id":"a9aeb0de-af7a-4d2c-a090-ed9fc881a92c","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Koedinger, K.R","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a366ee940afdee1ed71bf71a80b2ae0e84857eb9c081e93798075693fd957d71","observation_id":"d4e15f4a-b28e-4199-85d8-30ccc8e0fc49","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Azizsoltani, H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:292458d53be757e60881a3d04d5e6e68ec2298e7ca2866621794b312d9d2a1ab","observation_id":"c856f506-e62b-4dc0-9b01-71dd6eca9ef9","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Hadfield-Menell, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:e7658288f5356b88f65bd3c0354d739f1c7c70b099f9349c6050b814547435f0","observation_id":"c66d9341-a015-4b1f-becf-283dd6153289","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Stiennon, N","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:206e7819977183d73edfd6de14157a54227d4b79c0569fd03a840914a6b7df56","observation_id":"40bb3623-1326-41ec-81d1-d4f32bf8a991","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2604.04237."}