{"as_of":"2026-08-13T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:774a9371201cf64c3740606d9c8c7bb5ec43301061c52fc6c27393ccb5c49ae8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":87,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:28:47.669686Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":125,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-01T23:32:03.638122Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T12:21:53.058760Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/1906.01820"},"observation_digest":"sha256:59673e407dce6ba6fc0c221e605b71fc086b6c582c456f243b750b3fe13366e3","observation_id":"b94fdaa7-3843-4324-8855-114572c29861","resolution":{"observed_at":"2026-05-15T12:21:53.104437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"1906.08663","last_updated":"2019-06-20T14:35:03Z","snapshot_observed_at":"2026-07-06T08:01:41.630447Z","submitted_at":"2019-06-20T14:35:03Z","title":"Modeling AGI Safety Frameworks with Causal Influence Diagrams","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-25T19:47:10.770836Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/1906.08663"},"observation_digest":"sha256:adb2b80437ffe995628530a3a7eb7f055dad964e67582084dbc8f1c28752057b","observation_id":"d1e9dfd4-2010-4583-89d1-ed849309bbce","resolution":{"observed_at":"2026-05-25T19:51:10.658921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"1906.10918","last_updated":"2019-06-26T08:59:02Z","snapshot_observed_at":"2026-07-06T08:02:54.458844Z","submitted_at":"2019-06-26T08:59:02Z","title":"Towards Empathic Deep Q-Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T15:33:05.781171Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/1906.10918"},"observation_digest":"sha256:1022dcb7c0650a782bc2368f1a1711ea0e8e7614632beb8ff6cafc8ca08d3b30","observation_id":"d203dae5-4607-4bfa-86b9-7b75b60e10cb","resolution":{"observed_at":"2026-05-25T15:35:59.002481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"1907.00430","last_updated":"2019-06-30T18:55:31Z","snapshot_observed_at":"2026-07-31T07:30:17.794745Z","submitted_at":"2019-06-30T18:55:31Z","title":"Requisite Variety in Ethical Utility Functions for AI Value Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T12:15:10.057411Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/1907.00430"},"observation_digest":"sha256:e82577a64b8bce46d8cb11cddf64302611246c109eec5ccf583bee2cc877d3a1","observation_id":"f26a7609-fa77-4a48-9253-ea8d790485c0","resolution":{"observed_at":"2026-05-25T12:15:47.069147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:59:58.294355Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/1909.08593"},"observation_digest":"sha256:ec5012a1139dc12c5e6da59169339bbf1d419589827d40824c8cae93ff0ea96b","observation_id":"52c0de86-d26c-4b11-9896-78bc6a622517","resolution":{"observed_at":"2026-05-10T20:59:58.773063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T01:46:18.486086Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2009.01325"},"observation_digest":"sha256:9d8e5cdbbcbba8c8210003d111c4e29bcbe6b5aa34a395d8b31c5ed5cdc68919","observation_id":"d87632bb-493b-4517-bc0f-7ec226ed6527","resolution":{"observed_at":"2026-05-18T01:46:18.597410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T09:04:53.129737Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2210.10760"},"observation_digest":"sha256:e382b4550a0f4a510f7dec78b83a91a027be414e9743889c8298d6beff1be671","observation_id":"bb487044-62be-4736-a970-e6ac7f7712f4","resolution":{"observed_at":"2026-05-19T09:04:53.315297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T15:01:41.161487Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2211.03540"},"observation_digest":"sha256:3fcadfb43cea70530d93cf6e13e22447ed07208483f868d4a634ce8ef70514b7","observation_id":"bc09f87c-8d8a-4b89-85ed-780447feea9e","resolution":{"observed_at":"2026-05-17T15:01:41.314000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-10T11:37:23.229129Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:34:08.207848Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2212.03827"},"observation_digest":"sha256:5984f49fc66aeeadbdf309ae60d20d86766bbc01ce5e15dd88c4231c6b674135","observation_id":"838a7ba4-b93f-4f1f-9f8e-aa2f772f759b","resolution":{"observed_at":"2026-05-15T20:34:08.324344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-18T00:46:56.664582Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2304.06767"},"observation_digest":"sha256:abd851a966021c8d31f5e439f7ae35e3f6b4c1af8e475a9adb8577494bf7bdf9","observation_id":"376e6a77-db9e-484a-a804-6d0eca1b892b","resolution":{"observed_at":"2026-05-18T00:46:56.776915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:970d5db80bf21dc154882fcb809b512056835eff9adc508f3d0eca8e1e42dc61","observation_id":"321cb681-049f-486e-96dc-72cd871218ab","resolution":{"observed_at":"2026-05-24T07:44:08.548111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"reference_index":271,"source":"arxiv_source","source_observed_at":"2026-05-16T14:37:53.279275Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2402.05070"},"observation_digest":"sha256:572d98876679ef6910ff35a624c325be5ad0960e7d9edfaf785ba25ea3442871","observation_id":"086e11e0-497c-40dd-850b-e057234545be","resolution":{"observed_at":"2026-05-16T14:37:53.465693Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:237c72d2ea60603514bfc88d2a7bae0c653b761cfb196218f419582626ed5187","observation_id":"cb019c6b-8076-4151-a9e9-5fb79ce59bcc","resolution":{"observed_at":"2026-05-22T18:44:28.828850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:47708c020a54bc0d487beb1c5c89a5d4656e1c291d327c5130f8425fdc4a5d12","observation_id":"63a74004-5198-45c2-a7ab-c65270c68565","resolution":{"observed_at":"2026-05-18T06:38:37.136877Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-12T18:28:47.669686Z","title":"Scalable agent alignment via reward modeling: a research direction, 2018 b","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11504","last_updated":"2024-11-18T12:04:52Z","snapshot_observed_at":"2026-08-12T23:42:55.257931Z","submitted_at":"2024-11-18T12:04:52Z","title":"Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T18:28:47.669686Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2411.11504"},"observation_digest":"sha256:40ae10a6a28f40049b9672d3ad963457dc64e9fad66e4aaea3a4def36ad1c682","observation_id":"eb7444a7-eb29-4c93-9394-6d45ee2f02de","resolution":{"observed_at":"2026-08-12T18:28:47.669686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-12T17:23:13.690025Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.12643","last_updated":"2025-02-04T06:55:49Z","snapshot_observed_at":"2026-08-12T18:13:17.107806Z","submitted_at":"2024-11-19T16:54:30Z","title":"DLBacktrace: A Model Agnostic Explainability for any Deep Learning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:23:13.690025Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2411.12643"},"observation_digest":"sha256:0a27a4a9171026d6a6ec7578f4607fe05644531c56701badc26885bfa53ca170","observation_id":"69fad9f2-d5b7-4d57-b5ce-393613f57313","resolution":{"observed_at":"2026-08-12T17:23:13.690025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-11T19:09:54.741369Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-12T20:20:46.608401Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":188,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:54.741369Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b051504d749654b4eaef786cc02b1a07f08257d7057dd0a970cf83af2eb2300e","observation_id":"b76db881-6c47-4909-abd7-0cb3edd0fab4","resolution":{"observed_at":"2026-08-11T19:09:54.741369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-11T15:18:17.792623Z","title":"24 Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, and Shane Legg","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11145","last_updated":"2024-12-23T05:29:44Z","snapshot_observed_at":"2026-08-11T15:13:42.781175Z","submitted_at":"2024-12-15T10:34:06Z","title":"The Superalignment of Superhuman Intelligence with Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:18:17.792623Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2412.11145"},"observation_digest":"sha256:96fe5212dca2c0cc4274e46c507d17b5ab738fb88a1cad7694b4a63f4c2cd519","observation_id":"a28e9c60-0409-4a0e-ade6-96397527604a","resolution":{"observed_at":"2026-08-11T15:18:17.792623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-11T10:36:17.396795Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16468","last_updated":"2026-06-17T06:47:51Z","snapshot_observed_at":"2026-08-12T13:25:36.822411Z","submitted_at":"2024-12-21T03:51:04Z","title":"The Road to Artificial SuperIntelligence: A Comprehensive Survey of Superalignment","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T10:36:17.396795Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2412.16468"},"observation_digest":"sha256:abe0a78b96799be6bdf1ae35f8ce8dc5073090f92bde0abe8ef533b14b09c6b8","observation_id":"146ee1b6-60df-4fb6-a233-fbaab0d3e5fd","resolution":{"observed_at":"2026-08-11T10:36:17.396795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-10T22:45:12.304282Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00911","last_updated":"2025-01-01T17:58:31Z","snapshot_observed_at":"2026-08-12T10:57:21.495786Z","submitted_at":"2025-01-01T17:58:31Z","title":"Aligning LLMs with Domain Invariant Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:45:12.304282Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2501.00911"},"observation_digest":"sha256:ebe38d94e749a08f5a855c08e2d4d29672d70bcc77515b64d2b265e2ea937b55","observation_id":"2855cfac-44af-460d-9951-9d95e4373c8c","resolution":{"observed_at":"2026-08-10T22:45:12.304282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-10T17:50:56.420130Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13124","last_updated":"2025-01-21T05:36:13Z","snapshot_observed_at":"2026-08-10T22:23:15.426042Z","submitted_at":"2025-01-21T05:36:13Z","title":"Debate Helps Weak-to-Strong Generalization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:50:56.420130Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2501.13124"},"observation_digest":"sha256:f2260218e29a2fc27e6fa69020b534a3426a1ebabd8b7584ea47c66e539e4718","observation_id":"18412e5e-0a41-4f6d-a3dc-2769650d39ec","resolution":{"observed_at":"2026-08-10T17:50:56.420130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-10T00:11:59.191696Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18282","last_updated":"2025-06-03T20:18:22Z","snapshot_observed_at":"2026-08-12T03:26:23.910088Z","submitted_at":"2025-01-30T11:41:13Z","title":"Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T00:11:59.191696Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2501.18282"},"observation_digest":"sha256:c62ba21e14fad3b7b761580459e44451513a3f07d3dd8aff677f75117cc192d9","observation_id":"067cdd38-c458-4409-b732-4577e4929598","resolution":{"observed_at":"2026-08-10T00:11:59.191696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-11T20:23:30.763794Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2502.01456"},"observation_digest":"sha256:dd116fd9e513473afede909fea2779bdefe30d8bdbe3e3ba44fe6db3bd10dba6","observation_id":"e076956e-6c58-435c-8b9f-f2c327833128","resolution":{"observed_at":"2026-05-11T20:23:31.059761Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-09T05:02:13.217444Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03369","last_updated":"2025-02-05T17:07:37Z","snapshot_observed_at":"2026-08-09T12:36:37.004381Z","submitted_at":"2025-02-05T17:07:37Z","title":"Learning from Active Human Involvement through Proxy Value Propagation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T05:02:13.217444Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2502.03369"},"observation_digest":"sha256:97803329c3cea77c182e80c5b5e22d74bafa5539193b73e3b6d8bccc23cf9a7b","observation_id":"ab5c7713-fe20-4ef9-a9f2-ad7da4b506d9","resolution":{"observed_at":"2026-08-09T05:02:13.217444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-08T13:58:08.912648Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07065","last_updated":"2025-02-10T21:57:43Z","snapshot_observed_at":"2026-08-10T22:24:30.093477Z","submitted_at":"2025-02-10T21:57:43Z","title":"Active Inference through Incentive Design in Markov Decision Processes","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T13:58:08.912648Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2502.07065"},"observation_digest":"sha256:3debd593805af33f92a1a799c0b523501d17cfe895ae179b448bb6f933d7e2ac","observation_id":"9f76cd35-3b8d-44d2-9919-f1446876d4a9","resolution":{"observed_at":"2026-08-08T13:58:08.912648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-08T13:29:10.640998Z","title":"Scalable agent alignment via reward modeling: A research direction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-10T16:55:27.708579Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.640998Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:24f762d916d8ff872b93e49c9090ee3df634dd6a7572ce622aaa69f866a4af2c","observation_id":"f8dccded-8c51-48f6-b699-731479c7493b","resolution":{"observed_at":"2026-08-08T13:29:10.640998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:3ece9e83bd676e207f7823350f9b513f5fd5a4f8e323af85e3a49e5400b27257","observation_id":"bbb23fa1-8626-40e0-8e4b-0195ccf6c77d","resolution":{"observed_at":"2026-05-22T19:32:01.324270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T12:40:20.853268Z","title":"Frontal Lobe","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23930","last_updated":"2025-05-29T18:24:34Z","snapshot_observed_at":"2026-08-10T22:23:59.372390Z","submitted_at":"2025-05-29T18:24:34Z","title":"Exploring Societal Concerns and Perceptions of AI: A Thematic Analysis through the Lens of Problem-Seeking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:20.853268Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2505.23930"},"observation_digest":"sha256:c977d7fc71c9de2802bc5fa4b0eed0141effe77c34bd11f4a27e725676b3ac52","observation_id":"2667f632-86dc-4ae1-b8b1-24eca8b177bb","resolution":{"observed_at":"2026-08-07T12:40:20.853268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T11:11:40.565294Z","title":"Scalable agent alignment via reward modeling: a research direction, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-10T20:18:21.272344Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.565294Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:a999cb1c39f09dbe6c662ccbfaa08be503eaaf5be3baef99a6f1ab92638132b4","observation_id":"45a0b585-35d0-4e79-b213-a2c76e17bc74","resolution":{"observed_at":"2026-08-07T11:11:40.565294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T11:06:47.141529Z","title":"Scalable agent alignment via reward modeling: A research direction. arxiv 2018,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.141529Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:1d56d7c6bf656816676551139e5d0eac927b234c1999319d4df8bc0c49966d4e","observation_id":"5d2bb129-4ecb-4225-92d3-85b487ae0178","resolution":{"observed_at":"2026-08-07T11:06:47.141529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T10:40:06.800735Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04746","last_updated":"2025-06-05T08:27:34Z","snapshot_observed_at":"2026-08-10T22:24:25.860603Z","submitted_at":"2025-06-05T08:27:34Z","title":"Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:40:06.800735Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.04746"},"observation_digest":"sha256:57adb1ed85aaa13ad12da7de4b063ed1d6d0edbd44e0b6ffeb64546f5ae75f3b","observation_id":"853a6945-caa1-4574-bb72-90775fe66610","resolution":{"observed_at":"2026-08-07T10:40:06.800735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T04:55:42.722920Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09329","last_updated":"2025-06-11T02:08:52Z","snapshot_observed_at":"2026-08-12T18:14:32.655685Z","submitted_at":"2025-06-11T02:08:52Z","title":"Towards Efficient and Effective Alignment of Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:42.722920Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.09329"},"observation_digest":"sha256:c71adbb03aee7fc1d318f5ba1db2d958c3e8d9176a394cfcc8200dd8b882c145","observation_id":"4fc3d327-5031-45a9-bc38-86ab82cea280","resolution":{"observed_at":"2026-08-07T04:55:42.722920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T23:26:57.362934Z","title":"Scalable agent alignment via reward modeling: A research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17846","last_updated":"2025-06-21T22:45:19Z","snapshot_observed_at":"2026-08-07T19:34:31.461439Z","submitted_at":"2025-06-21T22:45:19Z","title":"Out of Control -- Why Alignment Needs Formal Control Theory (and an Alignment Control Stack)","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:57.362934Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.17846"},"observation_digest":"sha256:696ab6018b89ddca3741fe96851cd873ab7d6e82ba3c97dc5714f79bbe43229e","observation_id":"a75905cd-e4ab-40db-969b-80a1713f02c9","resolution":{"observed_at":"2026-08-06T23:26:57.362934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T22:44:44.175109Z","title":"Scalable agent alignment via reward modeling: a research di- rection.ArXiv preprint, abs/1811.07871, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.175109Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e32bc86dee29efafe9ad0ce6b4475eed4f72fbe6cab3845361c812e1d69fe4ff","observation_id":"f0891b52-ab44-40d8-b5bb-2d89b1cb5696","resolution":{"observed_at":"2026-08-06T22:44:44.175109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T20:43:27.141756Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02173","last_updated":"2025-07-02T22:12:03Z","snapshot_observed_at":"2026-08-07T13:56:29.658636Z","submitted_at":"2025-07-02T22:12:03Z","title":"Data Diversification Methods In Alignment Enhance Math Performance In LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:27.141756Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.02173"},"observation_digest":"sha256:b83c706236840c6288d15ee2cd242772a55ccb1de686ad5c138e90e86ef09e53","observation_id":"ca30404d-f858-4923-bbef-4c3b8c65c32b","resolution":{"observed_at":"2026-08-06T20:43:27.141756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T18:51:13.642658Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07045","last_updated":"2025-07-09T17:07:39Z","snapshot_observed_at":"2026-08-09T15:47:04.557022Z","submitted_at":"2025-07-09T17:07:39Z","title":"5C Prompt Contracts: A Minimalist, Creative-Friendly, Token-Efficient Design Framework for Individual and SME LLM Usage","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:13.642658Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.07045"},"observation_digest":"sha256:5a926dc2c591f3689fbf8035176f4317db910864a6a6087a45092ccdc8510d45","observation_id":"de72642e-059b-4375-af75-3174116c1109","resolution":{"observed_at":"2026-08-06T18:51:13.642658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T18:15:37.722075Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-08-13T00:14:07.970902Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:15:37.722075Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.08794"},"observation_digest":"sha256:bd2bcc78a642d20fb3f2da958b29cfe59f0ed994a183d09bb8152ccce93f2edf","observation_id":"00f4f874-3bec-43ef-a11b-88b37a366202","resolution":{"observed_at":"2026-08-06T18:15:37.722075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T18:00:04.754632Z","title":"Korsgaard, C","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.11552","last_updated":"2025-07-13T08:28:06Z","snapshot_observed_at":"2026-08-10T22:23:17.626206Z","submitted_at":"2025-07-13T08:28:06Z","title":"The AI Ethical Resonance Hypothesis: The Possibility of Discovering Moral Meta-Patterns in AI Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:04.754632Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.11552"},"observation_digest":"sha256:eed9eebcc001cc5588d2ce4cfd887ed3c439d3e4ed1a9cb84dd8d2cc0239eaf2","observation_id":"f13d4424-1aed-4394-9070-21d3e2c96fd9","resolution":{"observed_at":"2026-08-06T18:00:04.754632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T17:35:48.260173Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.260173Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:091f4faaebab5271953209a9289ce32b9ae9b2962d789b0fca4f707ef0cef36d","observation_id":"6893840f-8913-456c-8bfe-03992331d013","resolution":{"observed_at":"2026-08-06T17:35:48.260173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T13:26:21.098024Z","title":"Leike, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20728","last_updated":"2025-07-28T11:25:55Z","snapshot_observed_at":"2026-08-12T22:05:56.092185Z","submitted_at":"2025-07-28T11:25:55Z","title":"Learning the Value Systems of Societies from Preferences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:26:21.098024Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2507.20728"},"observation_digest":"sha256:fbf06f8bc0ac6271284d129554e700a452813552eda770fb804b148c0a887ba9","observation_id":"968bd471-84e3-41b6-900d-994e907fdce0","resolution":{"observed_at":"2026-08-06T13:26:21.098024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2508.06412","last_updated":"2026-05-07T07:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T15:56:49Z","title":"Sample-efficient LLM Optimization with Reset Replay","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T23:38:08.044450Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2508.06412"},"observation_digest":"sha256:ebcc4115220605991c7dc4966651379e1b60e0f73a590c6eb10705bb646d50a3","observation_id":"7ea747f1-0089-4256-a17b-1ce8ffe9fec6","resolution":{"observed_at":"2026-05-18T23:41:54.702361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T20:17:09.710424Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.710424Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:48ad26c6585cc7cb9c35d90148b47d432ebbd4546e7aba7e6149b97d463d2b40","observation_id":"71bf551d-680e-43a1-a83b-17835cde46b4","resolution":{"observed_at":"2026-08-05T20:17:09.710424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T16:17:54.908954Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.18765","last_updated":"2025-08-27T10:16:27Z","snapshot_observed_at":"2026-08-10T01:23:18.416406Z","submitted_at":"2025-08-26T07:48:55Z","title":"Governance-as-a-Service: A Multi-Agent Framework for AI System Compliance and Policy Enforcement","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:54.908954Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2508.18765"},"observation_digest":"sha256:55fdd64a9263a7cae7cad1b6b72a83ba918c1bf35d6afc5a3c9f65592743473d","observation_id":"5251e13c-1174-463d-a131-8903d4b20d22","resolution":{"observed_at":"2026-08-05T16:17:54.908954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T15:44:36.893471Z","title":"Designing agent incentives to avoid reward hacking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19562","last_updated":"2025-08-27T04:44:41Z","snapshot_observed_at":"2026-08-10T22:24:27.479235Z","submitted_at":"2025-08-27T04:44:41Z","title":"Democracy-in-Silico: Institutional Design as Alignment in AI-Governed Polities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:36.893471Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2508.19562"},"observation_digest":"sha256:35838a00ea76d2933588c017bfb9223f81168633d92300318d3aa0701c7c94d8","observation_id":"2a40b2d6-0391-4062-8c0f-1bc4c973d466","resolution":{"observed_at":"2026-08-05T15:44:36.893471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T15:37:43.446319Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.19697","last_updated":"2025-08-27T09:06:28Z","snapshot_observed_at":"2026-08-08T13:03:53.302123Z","submitted_at":"2025-08-27T09:06:28Z","title":"Safety Alignment Should Be Made More Than Just A Few Attention Heads","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:37:43.446319Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2508.19697"},"observation_digest":"sha256:5164add1b30d8ea0550aa2288b6ed76855dafedb231952049edd9cde1c228baf","observation_id":"d1f490a5-886d-44a7-ae8a-6e568a64fc81","resolution":{"observed_at":"2026-08-05T15:37:43.446319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T10:44:53.792642Z","title":"Scalable agent alignment via reward modeling: A research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.792642Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:35b3fed5921c174790148c6f1902cfd8f6ec8975ecbbfa2bf332bd7992b30218","observation_id":"a6500af1-ac20-43ba-9e3a-d7c9f5d72e2d","resolution":{"observed_at":"2026-08-05T10:44:53.792642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-04T10:56:37.116353Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.07884","last_updated":"2026-07-28T08:23:49Z","snapshot_observed_at":"2026-08-08T02:29:06.770355Z","submitted_at":"2025-10-09T07:37:23Z","title":"Contrastive Weak-to-strong Generalization","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:56:37.116353Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2510.07884"},"observation_digest":"sha256:00a771ebf138a759cf451a2bdf90ee6dfb9e2a5a9f69b6ab111d4b84cb70a804","observation_id":"57594bd1-0c0c-4f0a-9891-1937d44e3e1c","resolution":{"observed_at":"2026-08-04T10:56:37.116353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-04T07:21:22.501890Z","title":"Leike, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.26518","last_updated":"2026-06-25T13:34:02Z","snapshot_observed_at":"2026-08-10T01:21:56.171636Z","submitted_at":"2025-10-30T14:11:52Z","title":"Human-AI Complementarity: A Goal for Amplified Oversight","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:22.501890Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2510.26518"},"observation_digest":"sha256:1761dfd48e8c93f799ac74f4f3bc86f848a7a5ec5ec50b88861c6eeb923f8e8e","observation_id":"0a71921f-3217-4d3b-ba42-5238a305e796","resolution":{"observed_at":"2026-08-04T07:21:22.501890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2603.18633","last_updated":"2026-04-04T15:43:36Z","snapshot_observed_at":"2026-08-12T15:19:51.603520Z","submitted_at":"2026-03-19T08:58:10Z","title":"An Onto-Relational-Sophic Framework for Governing Synthetic Minds","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T08:57:58.369793Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2603.18633"},"observation_digest":"sha256:888e009c931490ffa47d73ce9c263f5c9e20c18166f280902028315f31bf04d8","observation_id":"6814fecb-f832-43ca-a1e4-42b35894e8e7","resolution":{"observed_at":"2026-05-15T08:59:53.040763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Krueger, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:3c1252c066dbe516fd0dbb51512b41fc52958cdc7ed51d7f53eae9b8b648ce66","observation_id":"6f694e5f-4080-4fd4-a56e-e8d684ac58a4","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-11T03:30:51.869417Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:cc9f8652fc0087e2e66016953fb7c22dd900b9294588d393cbd774806017a768","observation_id":"346dd22f-f42d-4ff7-83ba-9109cb697879","resolution":{"observed_at":"2026-05-10T14:00:28.208095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T17:58:26.932519Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:6087478c3256900228f4bf259a348b00230bbcbe125758869ca24bb56f61f4cf","observation_id":"290b8545-bbe7-4356-8202-21e39b3928a5","resolution":{"observed_at":"2026-05-11T23:11:17.604475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:20:52.825158Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:2ecaa541b4e1904a87d346b8fd9a2eeedd74bcbd32ab0d0e581fb41660388942","observation_id":"7eb3076e-cc94-4147-bf1f-713ed36275b1","resolution":{"observed_at":"2026-05-13T07:22:28.808425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T09:24:17.904893Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:8753e4aa70451b34d53681d6d9c904ea272d805804653bb12bc4a5c66f5879c1","observation_id":"8f5f280a-5801-49d8-b7b9-e24a601ce69b","resolution":{"observed_at":"2026-07-01T09:25:39.883682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-02T15:29:47.901857Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.24155","last_updated":"2026-07-29T10:57:33Z","snapshot_observed_at":"2026-08-02T15:29:43.628769Z","submitted_at":"2026-04-27T08:12:34Z","title":"The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T15:29:47.901857Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.24155"},"observation_digest":"sha256:93c5cf227d6867564f249ccfa457b326bfda5a1f00cd679f05af44aefe807e17","observation_id":"ecec322c-54ad-4663-8969-26e9f2fa5233","resolution":{"observed_at":"2026-08-02T15:29:47.901857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.26360","last_updated":"2026-06-26T14:36:46Z","snapshot_observed_at":"2026-08-11T17:49:26.596100Z","submitted_at":"2026-04-29T07:14:01Z","title":"Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T13:44:23.302523Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.26360"},"observation_digest":"sha256:96425ba10fea3297ef35b23e2521dcedeb567d3a1d5ceb39e5b8ef4c957c9660","observation_id":"ba094ca4-f60c-4c44-9d2b-3237657e92f1","resolution":{"observed_at":"2026-05-12T08:46:26.976967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2604.26360","last_updated":"2026-06-26T14:36:46Z","snapshot_observed_at":"2026-08-11T17:49:26.596100Z","submitted_at":"2026-04-29T07:14:01Z","title":"Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T08:26:03.578737Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2604.26360"},"observation_digest":"sha256:e48d3226e2fd36fe4d585561093da8b2f762a8112ab1acbd8a4854906eea03bc","observation_id":"15c88cbe-4c01-4dec-86a6-9f0b373e65f4","resolution":{"observed_at":"2026-07-01T08:35:33.800170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.01415","last_updated":"2026-05-02T12:26:22Z","snapshot_observed_at":"2026-08-08T11:45:12.128938Z","submitted_at":"2026-05-02T12:26:22Z","title":"AI Safety as Control of Irreversibility: A Systems Framework for Decision-Energy and Sovereignty Boundaries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T14:23:25.658703Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.01415"},"observation_digest":"sha256:cf7b870e3e6041d72d7f7c606a4477042a1b5e59eb1e4a8ec9d0aaaff3bea3f0","observation_id":"bd65d651-7eeb-464e-a2e7-6eecf7809936","resolution":{"observed_at":"2026-05-11T16:56:09.210282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.01643","last_updated":"2026-05-11T16:34:28Z","snapshot_observed_at":"2026-08-11T13:53:27.492099Z","submitted_at":"2026-05-02T23:28:02Z","title":"AI Alignment via Incentives and Correction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T14:07:44.717260Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.01643"},"observation_digest":"sha256:9de8a9e2fe3e82798f55095e567a10a611c4572ffc1d37a7d7c627409247293a","observation_id":"91f3e312-3992-454c-9b1d-5a4be522007a","resolution":{"observed_at":"2026-05-11T17:01:10.353808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.01643","last_updated":"2026-05-11T16:34:28Z","snapshot_observed_at":"2026-08-11T13:53:27.492099Z","submitted_at":"2026-05-02T23:28:02Z","title":"AI Alignment via Incentives and Correction","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:51:31.357544Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.01643"},"observation_digest":"sha256:25159bd2cfd6ad1d9e02d9659ec95543bf19277e3b4e3127ff26d538615e9548","observation_id":"dd840523-7196-4847-812e-c7d2c448744b","resolution":{"observed_at":"2026-05-12T05:51:26.656504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.03512","last_updated":"2026-05-05T08:49:51Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T08:49:51Z","title":"Brainrot: Deskilling and Addiction are Overlooked AI Risks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T13:30:02.923661Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.03512"},"observation_digest":"sha256:d53bc0eb9ce36631d2e17f5f0956f883dca02a94c6b5fe3ba0722b52644b78f6","observation_id":"11287020-73ed-4169-9207-669247e1193f","resolution":{"observed_at":"2026-05-12T11:01:30.840167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.06390","last_updated":"2026-05-14T21:52:09Z","snapshot_observed_at":"2026-08-13T00:25:42.864465Z","submitted_at":"2026-05-07T15:06:37Z","title":"Automated alignment is harder than you think","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T09:47:05.526632Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.06390"},"observation_digest":"sha256:8810f2b9a59ac1ddc17c3e1e44b572e743fb4979e7532e484f9089271430574c","observation_id":"ee9e7ea6-dfa6-4125-bf1c-c3544f0324dc","resolution":{"observed_at":"2026-05-11T20:16:10.148716Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.12809","last_updated":"2026-05-12T23:01:29Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:01:29Z","title":"Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces","version":1},"reference_index":222,"source":"arxiv_source","source_observed_at":"2026-05-14T20:17:01.224864Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.12809"},"observation_digest":"sha256:734e4794935460fda315e08685f0972f429a3afa0ba5a2d129b65403b3911f1a","observation_id":"0a830ea8-b730-42b0-b3fd-fec8c5087a4d","resolution":{"observed_at":"2026-05-14T20:17:55.512128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.14588","last_updated":"2026-05-19T14:15:06Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:59:26Z","title":"Silent Collapse in Recursive Learning Systems","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T20:07:57.071410Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.14588"},"observation_digest":"sha256:882037c61b176b8666882dbe3e37c0588d262a588402a24aa9bbc452369cbac7","observation_id":"302cc156-bda3-4183-ae8a-9a7e927eb4c5","resolution":{"observed_at":"2026-05-20T20:08:59.149378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:b9032b747b9ce58307a2b2e860087d4bf3c3908b23e432af6110488e660a1485","observation_id":"1ef68a19-2b98-47dc-ab8a-36b11d113ca7","resolution":{"observed_at":"2026-05-19T16:27:39.609156Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.25629","last_updated":"2026-05-26T08:05:15Z","snapshot_observed_at":"2026-08-10T22:23:18.160574Z","submitted_at":"2026-05-25T09:30:49Z","title":"When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T21:23:35.843524Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.25629"},"observation_digest":"sha256:e3d1efd0cadd91f30535a9799640c656383eb9098da6873d28f55e2ba8e17397","observation_id":"b979e1aa-d578-4595-8afc-95e9cbceae06","resolution":{"observed_at":"2026-06-29T21:23:58.707769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2605.25739","last_updated":"2026-07-19T12:16:05Z","snapshot_observed_at":"2026-08-02T13:17:54.641684Z","submitted_at":"2026-05-25T11:51:08Z","title":"The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:28:02.493124Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.25739"},"observation_digest":"sha256:0e7fba26abe27bf548be913a0938844d79df000d3a911f8a3e28ed4e656ac1a0","observation_id":"2858b5f3-6215-4f10-9aa0-61270355617d","resolution":{"observed_at":"2026-06-29T22:34:01.895887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-02T13:17:57.009987Z","title":"Scalable agent alignment via reward modeling: a research direction.arXiv preprint arXiv:1811.07871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25739","last_updated":"2026-07-19T12:16:05Z","snapshot_observed_at":"2026-08-02T13:17:54.641684Z","submitted_at":"2026-05-25T11:51:08Z","title":"The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible","version":2},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-02T13:17:57.009987Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2605.25739"},"observation_digest":"sha256:8964b17ea5d03c3e480d2f10f52737ac421eeb1d4b17e5dc25f040fa109000dd","observation_id":"2096c4f9-dca9-4785-8631-9ae77de9396e","resolution":{"observed_at":"2026-08-02T13:17:57.009987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.02866","last_updated":"2026-06-01T20:29:47Z","snapshot_observed_at":"2026-08-09T19:09:15.706708Z","submitted_at":"2026-06-01T20:29:47Z","title":"When Helping Hurts and How to Fix It: Multi-Agent Debate for Data Cleaning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:05:49.696342Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.02866"},"observation_digest":"sha256:bfc611d7ef004f5c80af2387810a6e4e5d76a922ed3366984544c61709c14a9b","observation_id":"c2e71a42-012c-47ec-892c-040bd312a826","resolution":{"observed_at":"2026-07-01T23:36:23.867402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.05625","last_updated":"2026-06-04T02:50:26Z","snapshot_observed_at":"2026-08-03T12:10:14.218564Z","submitted_at":"2026-06-04T02:50:26Z","title":"Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T01:57:14.160273Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.05625"},"observation_digest":"sha256:4e6a4a84f654441a8a4017d110a683dc86fcb5a6d1f28452bb186723aae3d494","observation_id":"6d0bac49-ca62-46cc-a8b3-0edc1f23e5ce","resolution":{"observed_at":"2026-07-02T12:36:57.243461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:5600313c6b63c7f206b5853b70980860ddb9199ad22588318d0b0bacf214b047","observation_id":"0a850ee1-20d6-4505-89d1-7c224499ee90","resolution":{"observed_at":"2026-07-03T01:37:30.372342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.11533","last_updated":"2026-06-10T00:34:04Z","snapshot_observed_at":"2026-08-12T16:16:59.874728Z","submitted_at":"2026-06-10T00:34:04Z","title":"AI Researchers Must Help Lead Arms Control to Mitigate Military AI Risks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T08:26:57.379418Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.11533"},"observation_digest":"sha256:7738a4a92de4faf846f57197c73681357e78983a35a17fd57931d872ecf94d26","observation_id":"604eccae-230a-4312-8723-db246ae5877e","resolution":{"observed_at":"2026-07-03T13:08:08.763950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.19924","last_updated":"2026-06-18T08:20:33Z","snapshot_observed_at":"2026-08-05T14:43:36.349636Z","submitted_at":"2026-06-18T08:20:33Z","title":"The Tao of Agency: Autotelic AI, Embedded Agency and Dissolution of the Self","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-06-26T17:34:46.741962Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.19924"},"observation_digest":"sha256:e674fdcac3b8808a2ad7d24119a6ed33e89b1899caa757592998d958ac481cf5","observation_id":"34fd7f76-8c20-48b0-a40f-eac988dbbaff","resolution":{"observed_at":"2026-07-04T03:49:30.871078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.21321","last_updated":"2026-06-19T11:10:26Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T11:10:26Z","title":"Objective-Behavior Alignment: Diagnostics for MORL Policy Selection","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-26T14:34:58.398278Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.21321"},"observation_digest":"sha256:450103cc0f49c102bf313204725b0cf87c9c110985ea1609af2e9e4b2580f2b5","observation_id":"45b653c3-268d-494b-967d-96ed487c5700","resolution":{"observed_at":"2026-07-04T06:19:38.545439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2606.21550","last_updated":"2026-06-19T15:47:01Z","snapshot_observed_at":"2026-08-08T02:38:40.288019Z","submitted_at":"2026-06-19T15:47:01Z","title":"AI Alignment From Social Choice Perspectives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:12:36.892697Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.21550"},"observation_digest":"sha256:2d32820cdb00644ed840c16a6b4801b33479cef4a386edf89186d14b61f5e3db","observation_id":"8bd9b28e-0363-4cd5-b607-d46f485e04d0","resolution":{"observed_at":"2026-07-04T06:49:37.682452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-12T11:23:07.646178Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.28639","last_updated":"2026-07-06T12:56:49Z","snapshot_observed_at":"2026-08-08T14:05:07.687605Z","submitted_at":"2026-06-26T22:51:16Z","title":"The Unverifiability of Artificial General Intelligence (AGI) Alignment, Static and Dynamic: From Trakhtenbrot's Wall to the Safety-Generality Tension","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T11:23:07.646178Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2606.28639"},"observation_digest":"sha256:0fc5ae919e82c4f77ff073e1dc4d24a58eda20c8247d791a3d9f9c19126dcd2b","observation_id":"2deda88b-774f-4af2-985e-a446b8904f59","resolution":{"observed_at":"2026-07-12T11:23:07.646178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-13T14:35:55.709732Z","title":"Leike, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.00001","last_updated":"2026-04-01T17:12:42Z","snapshot_observed_at":"2026-07-13T14:35:55.309214Z","submitted_at":"2026-04-01T17:12:42Z","title":"Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-07-13T14:35:55.709732Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.00001"},"observation_digest":"sha256:9e37ce87596cdfe4a2afcdd875ffc0c6e491636ca2ef8298671dfd1a42ef8ea8","observation_id":"f76ab2fe-e0e2-4b9f-873b-193d816330ba","resolution":{"observed_at":"2026-07-13T14:35:55.709732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:1811.07871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":170,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:7d86fdd810c37c3842a75111047b359c94d50bef5d6ba75cbc59a73a113e1199","observation_id":"d133d6e5-7d41-4d4a-a333-c5e7d559ee95","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-12T01:34:45.323277Z","title":"arXiv preprint arXiv:1811.07871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03561","last_updated":"2026-07-03T18:49:20Z","snapshot_observed_at":"2026-08-06T10:12:06.987067Z","submitted_at":"2026-07-03T18:49:20Z","title":"How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-12T01:34:45.323277Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.03561"},"observation_digest":"sha256:490d938d2baa0602e2eebef40473505c8f077a178bbe108b5b90867ae688e5d7","observation_id":"fcaf0638-9baf-4b6f-ba54-6d5a5ed255e1","resolution":{"observed_at":"2026-07-12T01:34:45.323277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-11T16:47:52.768236Z","title":"Scalable agent alignment via reward modeling: A research direction, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04590","last_updated":"2026-07-06T01:33:12Z","snapshot_observed_at":"2026-08-05T13:00:19.375765Z","submitted_at":"2026-07-06T01:33:12Z","title":"Attention Limited Reward Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T16:47:52.768236Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.04590"},"observation_digest":"sha256:c648a3cf3e15b48dbf0067f6c76a44da5987dcdb8a468ceb12a92ccbf114c9ea","observation_id":"514601cb-6a7d-4996-94de-f388951ae611","resolution":{"observed_at":"2026-07-11T16:47:52.768236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-07T12:31:42.224094Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:c2bb536ccb609ca2e188d6906fe1538fa99fb3df6523406068947a8428c503dc","observation_id":"a0ef56ba-a906-45f4-8759-0fcb74e602fd","resolution":{"observed_at":"2026-07-07T12:33:45.005293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Scalable agent alignment via reward modeling: a research direction.arXiv preprint arXiv:1811.07871, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:a1fd8d59b1eaef14ae1158873e2c11d340d2df6b743cedd5503c069d46c293c2","observation_id":"0fbe11a8-925b-4d49-8365-804d4389dcb3","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-02T06:06:14.400874Z","title":"arXiv:1811.07871 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13172","last_updated":"2026-07-14T18:22:14Z","snapshot_observed_at":"2026-08-10T23:10:31.110708Z","submitted_at":"2026-07-14T18:22:14Z","title":"Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:06:14.400874Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.13172"},"observation_digest":"sha256:0d749a08bf355f40d535023fa07e948e00b14ece6557d1fc474eaa5ce03d4a68","observation_id":"ee0177bf-6ff1-4f8b-9caa-d4173551a443","resolution":{"observed_at":"2026-08-02T06:06:14.400874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-01T08:32:00.178072Z","title":"arXiv 2018 , author=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21120","last_updated":"2026-07-23T09:55:45Z","snapshot_observed_at":"2026-08-05T03:29:01.517081Z","submitted_at":"2026-07-23T09:55:45Z","title":"Relative Value Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T08:32:00.178072Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.21120"},"observation_digest":"sha256:62b13a25f93ac941c75163878a8d46700e056f2c3ac9e3e99340343a2909d38f","observation_id":"5349a75b-0367-4be7-99c1-a8f420d5ca75","resolution":{"observed_at":"2026-08-01T08:32:00.178072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-07-31T00:06:00.562062Z","title":"Scalable Agent Alignment via Reward Modeling: A Research Direction,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25152","last_updated":"2026-07-27T23:52:15Z","snapshot_observed_at":"2026-08-03T20:51:37.077654Z","submitted_at":"2026-07-27T23:52:15Z","title":"When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T00:06:00.562062Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2607.25152"},"observation_digest":"sha256:bc849f6a7e2ef8108a443692c8cce99715add8a2a87aa1b752c325a688faefd1","observation_id":"8aba963f-f187-4d10-82b5-07710c08c0d8","resolution":{"observed_at":"2026-07-31T00:06:00.562062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-06T19:33:38.747570Z","title":"ArXivabs/1811.07871 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04663","last_updated":"2026-08-05T10:21:11Z","snapshot_observed_at":"2026-08-10T17:14:46.668800Z","submitted_at":"2026-08-05T10:21:11Z","title":"Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:33:38.747570Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2608.04663"},"observation_digest":"sha256:298f0dd70ef7e615a55c337a33119eb2b8b2f19e04b3864594f3b0283377242b","observation_id":"e4a00365-adb6-467d-b5f8-9001742877bb","resolution":{"observed_at":"2026-08-06T19:33:38.747570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-10T11:13:43.697532Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07280","last_updated":"2026-08-07T14:39:10Z","snapshot_observed_at":"2026-08-12T23:12:42.137048Z","submitted_at":"2026-08-07T14:39:10Z","title":"Why Study Emergent Behavior When You Can Regulate It? Aligning Multi-Agent Systems with Reward Prediction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T11:13:43.697532Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2608.07280"},"observation_digest":"sha256:26e4b079819d178a5b30d35871679a8f0de1a39415e8b8c8a7d2acaf799c9105","observation_id":"3cc8b0a5-815d-48cf-9357-d58ee0e680b0","resolution":{"observed_at":"2026-08-10T11:13:43.697532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1811.07871/citation-record","integrity":"/paper/1811.07871/integrity","json":"/paper/1811.07871/citation-record.json","paper":"/paper/1811.07871"},"outbound":[],"paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 87 inbound Pith citation observations for arXiv:1811.07871."}