{"as_of":"2026-08-16T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48d236f294c34aafcf6c1b52923ebf0dd4941ac5559b38dc4ad39a2bb6ca3374","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:40:09.533305Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:29:18.049711Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:07:56.781634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":"2504.20157","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7dbe72ba-e72c-46f3-b595-ea3ff2094d96","year":2025},"citing_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:56.678339Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2507.17746"},"observation_digest":"sha256:dbe6c2d045ec94cf60d5d74b915f29e078ecf3adba9bc37d16dbf54f0d863067","observation_id":"4a11841a-1d3f-494b-b92f-976e3a3625a3","resolution":{"observed_at":"2026-05-13T06:07:56.785000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-07-31T23:52:09.180660Z","title":"arXiv preprint arXiv:2504.20157 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23333","last_updated":"2026-07-25T19:11:15Z","snapshot_observed_at":"2026-08-03T00:37:21.399146Z","submitted_at":"2026-07-25T19:11:15Z","title":"Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex","version":1},"reference_index":222,"source":"arxiv_source","source_observed_at":"2026-07-31T23:52:09.180660Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2607.23333"},"observation_digest":"sha256:000d7728d8f9f183f9a8fac4c29fd1f4c9bf14fa07ad2b0cdd76655dfb373a2a","observation_id":"514714e3-6952-4251-a15e-d7d09cae203f","resolution":{"observed_at":"2026-07-31T23:52:09.180660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-08-14T04:29:18.049711Z","title":"Toward evaluative thinking: Meta policy optimization with evolving reward models.arXiv preprint arXiv:2504.20157, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-16T08:49:55.429631Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.049711Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:d31aa66947a08e4e673bf24ed529ba3092187029d80c4a5c772cf799d0968011","observation_id":"7112acee-2383-4d63-9ac7-fbb30715048d","resolution":{"observed_at":"2026-08-14T04:29:18.049711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20157/citation-record","integrity":"/paper/2504.20157/integrity","json":"/paper/2504.20157/citation-record.json","paper":"/paper/2504.20157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.128421Z","title":"Ahmadian, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.128421Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:ab48a17b999e93f5713855cebec9209649ba9b6bb610ead6079c5ba31cc4ea10","observation_id":"84014ee3-0a43-46f5-b326-d6970b87b155","resolution":{"observed_at":"2026-08-16T05:40:09.128421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.879218Z","title":"Amodei, C","venue":null,"work_id":"806fd1fd-6ffe-4490-bee4-92181ed46358","year":2016},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.135897Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:20fa743748ed01cd0f25a31363817f3e804d9bf82880c1b3a401b3b07514844a","observation_id":"4306b0ca-f5f8-4992-8f57-d901d427a5b4","resolution":{"observed_at":"2026-08-16T05:40:10.884168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T05:40:09.141124Z","title":"Amodei, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.141124Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b66922ee133754424f0171447339e198577f3a2fc61f2adebdc5c5f17dfd34d9","observation_id":"a224da52-802f-42ba-b81f-db6ed05552aa","resolution":{"observed_at":"2026-08-16T05:40:09.141124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T05:40:09.146832Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.146832Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f027ab8088dd9793b07131ad96ed0874d95aba5c4d7e1d77a15b9afb72d26159","observation_id":"556e3ce8-83e2-4569-969f-8804d3cc9109","resolution":{"observed_at":"2026-08-16T05:40:09.146832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.863327Z","title":"Buckley, T","venue":null,"work_id":"9ffe2eb8-8dd5-4538-998d-26e2c0c14520","year":2015},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.152614Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:73f9f90a594c44b4d7b012f5437c739fb879c47e4f1c3d437ff8a78b113bd0a4","observation_id":"10bd2885-16aa-4cf9-9b8a-fa048e6f08a9","resolution":{"observed_at":"2026-08-16T05:40:10.868225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07319","last_updated":"2024-02-11T22:40:12Z","snapshot_observed_at":"2026-08-16T14:19:30.130925Z","submitted_at":"2024-02-11T22:40:12Z","title":"ODIN: Disentangled Reward Mitigates Hacking in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07319","snapshot_observed_at":"2026-08-16T05:40:09.158251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.158251Z"},"links":{"cited_paper":"/paper/2402.07319","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:493eb6e14c642791c6538705c3e252efe85b56344293c91d44ab95896d2bd715","observation_id":"91c60746-0dce-4ca3-a41b-b26db3800892","resolution":{"observed_at":"2026-08-16T05:40:09.158251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.847587Z","title":null,"venue":null,"work_id":"32fce83c-6c9a-4a6b-9ed6-53c4e68f3df4","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.164194Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b7d16100a41379dd8766119660993b132da78e30b259d2539a603b9e9145161e","observation_id":"ae0345da-19bc-4bd4-81e0-f040ef5bffa9","resolution":{"observed_at":"2026-08-16T05:40:10.852486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-16T05:40:09.169269Z","title":"Chiang, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.169269Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:d2cb1efc8e258e9773d0fbda7dd0d8c34566abeef58daf866ebd26f65dccd8c9","observation_id":"50b31a4f-c1f1-43c9-a793-b8ba75fb26f4","resolution":{"observed_at":"2026-08-16T05:40:09.169269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.831375Z","title":"Coste, U","venue":null,"work_id":"8d075fc1-0c9c-4a17-b69a-ebb5619237b6","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.174620Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:dcb01c121feca00db3cf36f5c023646718b5f9b882ac6a8a583399900556df6a","observation_id":"32ef45af-468c-4eac-8426-7e477df43f2b","resolution":{"observed_at":"2026-08-16T05:40:10.836698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.815777Z","title":null,"venue":null,"work_id":"5a7882ab-6637-48d7-9f4b-63ff33e34073","year":1971},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.179775Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:482ddbf099c694dfb86e11a565d551ea4b865cafe442c9d1a3da751607033f61","observation_id":"836b619c-f099-4806-bf18-aa63d08c53d9","resolution":{"observed_at":"2026-08-16T05:40:10.820404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T05:40:09.184730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.184730Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:c507be565512af108f737ba1f044a29e3a09a52c33133f08a293d7f37b5fe106","observation_id":"ae088c77-19a0-410f-835a-817d8ce11952","resolution":{"observed_at":"2026-08-16T05:40:09.184730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-16T05:40:09.189989Z","title":"Denison, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.189989Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:35ba80d3a971f0fa105789dad12a2305a4e8ac9975ef216fefe4a09190a67323","observation_id":"66984877-6b63-4282-ba84-e1fa7d93d77a","resolution":{"observed_at":"2026-08-16T05:40:09.189989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.799758Z","title":null,"venue":null,"work_id":"87839079-57a7-48c9-a40d-848e6262df41","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.195069Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:afa1a33c2066dfc7e73b8c325b1173e3927d91081c14aa596f5fc2eed6d4fb8d","observation_id":"192bcb4f-0014-4344-86d5-96a3f0016df2","resolution":{"observed_at":"2026-08-16T05:40:10.804793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.783933Z","title":"Efklides","venue":null,"work_id":"8d4fa2db-dc87-43b2-8e34-9e70f9302f3b","year":2006},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.199747Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:90164d7f30adf0702a4f35deb89644c4928a577c7d77cd9788d8f6eaf25fad58","observation_id":"f2d9a440-6136-4c47-9383-4967c4f8086f","resolution":{"observed_at":"2026-08-16T05:40:10.788673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.766903Z","title":"Eisenstein, C","venue":null,"work_id":"2cb49555-e91f-4bc5-950e-836b37ec3995","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.204248Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:71c99ff1fc446b9ea073425db5aad6bcf58a8614a89a243ddc473d15e8162a79","observation_id":"e1af0d2c-812f-41fd-9a01-dd322fcab31e","resolution":{"observed_at":"2026-08-16T05:40:10.772380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-16T05:40:09.208936Z","title":"Ethayarajh, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.208936Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e012ffed94d505e0111902a0cbc6e50030c6052b197040944c86af701bee24c1","observation_id":"f4431f81-cd12-44f6-bb02-e79f62bbd885","resolution":{"observed_at":"2026-08-16T05:40:09.208936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.749605Z","title":"Everitt, M","venue":null,"work_id":"af73bb33-f210-43c6-824e-0a28a85f17a4","year":2021},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.213859Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:318513c8a9e61228cef9acce3aacb82bb3342656ae27383148b3335272c61bc0","observation_id":"d57dbda2-dc2e-4c8b-8c38-bf3675930d1a","resolution":{"observed_at":"2026-08-16T05:40:10.754664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.733302Z","title":null,"venue":null,"work_id":"0b8faf73-2f2c-474d-8411-aa14bfdaf87d","year":1979},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.219104Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:dbff7784a468ea48ac46ffb2eee2d0f9636a4e54c45ad5fda014dcd52135a005","observation_id":"69bd380b-f029-45cd-b87c-8e663f6923cc","resolution":{"observed_at":"2026-08-16T05:40:10.738502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15753","last_updated":"2025-07-08T16:17:15Z","snapshot_observed_at":"2026-08-16T13:40:33.758636Z","submitted_at":"2024-06-22T06:43:51Z","title":"The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15753","snapshot_observed_at":"2026-08-16T05:40:09.223889Z","title":"Fluri, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.223889Z"},"links":{"cited_paper":"/paper/2406.15753","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b05a72990d20652c631e88fdaf1d5757ff2b66c28076905ce07045e30d78c79c","observation_id":"1088a2dc-d7d6-4b3d-aafb-dbb2db24837c","resolution":{"observed_at":"2026-08-16T05:40:09.223889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-13T18:34:28.304602Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-16T05:40:09.228950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.228950Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:dbc296ecf6f0b566f4811900e644be22ad836f9d8824fd371bbcffb939f31458","observation_id":"622f78c8-129d-48ff-a38f-179609261787","resolution":{"observed_at":"2026-08-16T05:40:09.228950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.717422Z","title":null,"venue":null,"work_id":"3984b20e-a10d-4b65-92e5-6bf80b55c3af","year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.233843Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:a79c0502130854db4501bbd9a312a2c1e4e78667cf0524a6476bcb2943c68f1f","observation_id":"8c964a05-3372-4c03-81cd-062246a087ae","resolution":{"observed_at":"2026-08-16T05:40:10.722228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.701092Z","title":"Hamner, J","venue":null,"work_id":"27455af0-a80a-4520-b8eb-42d91c73e639","year":2012},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.238853Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f29e5415a87bff4f30c28acadc7558472b1a3a1da4925551d17d20fed13af4eb","observation_id":"972e2a40-d167-4af7-9275-05ca3f9ee066","resolution":{"observed_at":"2026-08-16T05:40:10.706274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.684964Z","title":"Hendrycks, C","venue":null,"work_id":"6ebc57f2-312e-469c-8cdd-b4609eb9a2ca","year":2021},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.243702Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:a42b5b08fc473eb6e43ed3b96eaf5bd28ee3e968d66066536d8543303a8c780b","observation_id":"9a360b64-3cbf-43bd-8b13-02fa13c14d9c","resolution":{"observed_at":"2026-08-16T05:40:10.689981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.249327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.249327Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:57fa340c15d3fb3d077ce9bf8263f79b0ac8bf429e5ea46b8760bcc4d9d3d39c","observation_id":"4b777d64-80d6-4460-95d2-25b7b5664f22","resolution":{"observed_at":"2026-08-16T05:40:09.249327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.254238Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.254238Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:88b33a25060c5f1b74e5d1c24d05a9f409f7d3a7ccc080c25f81767b27eefd9b","observation_id":"4d4d5521-3aff-4dd4-b14c-0c29b73a4b73","resolution":{"observed_at":"2026-08-16T05:40:09.254238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.259920Z","title":"Kornilova and V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.259920Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:3e532b84076a514cb0dad5f6c42d4c39e4b3ceef6e03c2fe55576290818e6976","observation_id":"a1ad9198-c9d1-4078-ab47-40aee5bc693b","resolution":{"observed_at":"2026-08-16T05:40:09.259920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.265135Z","title":"Krakovna, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.265135Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:de4656f0c7fa4ba52444bd28d4362d1e7ade1b9bab3e2eb5f909ef025c7e94d9","observation_id":"f38cfb96-0bc9-4eea-a2aa-15bd1d42b31b","resolution":{"observed_at":"2026-08-16T05:40:09.265135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.658221Z","title":null,"venue":null,"work_id":"14b29930-516f-458f-ba7e-622140245581","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.270126Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:baa0bc492be9945eec0c11bfc997839dbaf0842a96917bfb55e6a0a380bcf34b","observation_id":"433df192-df45-420f-9bb0-346297af1b6e","resolution":{"observed_at":"2026-08-16T05:40:10.663066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.641766Z","title":null,"venue":null,"work_id":"f3300476-4586-40ca-a949-5077971211aa","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.274936Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5149f118009f2dfcabb27bea093d715bdc3d3a713f1386121450d041823aefbf","observation_id":"5f8948f6-c1b9-43c5-a354-fc31c7dbf8ca","resolution":{"observed_at":"2026-08-16T05:40:10.647596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.284787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.284787Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:c4f0607823b02a0a2de462272c0fd5a790cb16b177aa7a09056defc9c247369f","observation_id":"65d092b0-0a66-4b03-80bc-38d1630052be","resolution":{"observed_at":"2026-08-16T05:40:09.284787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.615087Z","title":null,"venue":null,"work_id":"3234d5b2-a7d0-4e6b-bf76-3d746da36798","year":2004},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.289547Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:27ef2f131854c5deb28529bef2c65ab9f15cf600b5cfd5cd374044fdb5cc2450","observation_id":"5fb6f3bd-3dd9-4bce-8e61-4dd24a6dfc98","resolution":{"observed_at":"2026-08-16T05:40:10.619821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.599551Z","title":null,"venue":null,"work_id":"57b9f932-d327-4dd4-8510-dd39e822cf0f","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.294328Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:1f8651fb1c64cd1c6d2770f1ff08d08cb5678cd8ac830e2292a27a7cda006553","observation_id":"2b6b871e-def0-4485-8e08-94be64156b19","resolution":{"observed_at":"2026-08-16T05:40:10.604313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-08-16T13:17:01.360159Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-16T05:40:09.300373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.300373Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:514b886c2c8af3549a65e6b94fffa475654bcfae4f08953d80c6828e918a43bf","observation_id":"2a05bfa3-4df1-45af-a08b-56cb3225c0e6","resolution":{"observed_at":"2026-08-16T05:40:09.300373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.583152Z","title":null,"venue":null,"work_id":"b7fc7bb6-3896-4c2d-9f8f-80defb908ea9","year":1979},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.305542Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:d8c74c7ccf2ff21dfea7c38c81c6a56a5299fbcec8edfe9a29e8ae3402e9c19f","observation_id":"35f4bdc6-319e-43c5-9303-46afe503f3c0","resolution":{"observed_at":"2026-08-16T05:40:10.588317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.567765Z","title":"Lourie, R","venue":null,"work_id":"d7434535-74eb-4cf7-9a40-f45952108e2d","year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.310275Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e55e25b5be0103b38e4b3737b26232ec74e7c1fdad4ec107fb77634df4c43b39","observation_id":"8facfa69-c929-44de-be2e-537ca11185c1","resolution":{"observed_at":"2026-08-16T05:40:10.572366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.551811Z","title":null,"venue":null,"work_id":"3dcf9c9b-6f3b-44c1-bc15-0768c006a34f","year":1987},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.315294Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:cf4ea6d24bf6f70ae2f48918e54b5c310dcb0057540d7428bd9beceba213673b","observation_id":"a83fbe96-8807-4a2b-83df-d972bad9ed09","resolution":{"observed_at":"2026-08-16T05:40:10.556775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.535393Z","title":null,"venue":null,"work_id":"f5d46b66-aa3e-4106-b60a-0e61677e2915","year":2003},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.319942Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:542d116834b35d14e18a474e806efa8daa3fda60ff83a821c453e6f9cc672306","observation_id":"a9e4a206-746d-4a89-bc50-5f3bbb6f1d3e","resolution":{"observed_at":"2026-08-16T05:40:10.540436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.519219Z","title":null,"venue":null,"work_id":"7550f5fb-c920-4fd8-9db9-b04d46b5dc71","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.324685Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:14d28ccace10bba0b18a0f6d33e7f0c6d3215bcbda8878a859f246189ebd239f","observation_id":"7b1aaf42-37b4-471c-ae6c-3b964cf90611","resolution":{"observed_at":"2026-08-16T05:40:10.524150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jml.2004.12.001","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.591791Z","title":"Metcalfe and N","venue":null,"work_id":"70e0b742-54ef-40b9-86ef-e7dbca658bfc","year":2005},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.329272Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f1a80cad7a357921e120c101136fc43d83d24b57e92d280edb24f254579e34b5","observation_id":"527e7dc8-f5f6-4d90-8a32-520471788536","resolution":{"observed_at":"2026-08-16T05:40:09.598519Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.500573Z","title":null,"venue":null,"work_id":"b2dc2f41-860f-44c6-be14-d3590ad56917","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.334058Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e9b173a659b5c0f1aca03a056fa8f9a21a030ece8f60bfcab7fde6c8089debdb","observation_id":"a58260a0-9af0-45cf-8590-43ca5d4e1164","resolution":{"observed_at":"2026-08-16T05:40:10.506102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19358","last_updated":"2025-06-02T16:30:23Z","snapshot_observed_at":"2026-08-16T10:37:45.490190Z","submitted_at":"2025-01-31T18:10:53Z","title":"The Energy Loss Phenomenon in RLHF: A New Perspective on Mitigating Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19358","snapshot_observed_at":"2026-08-16T05:40:09.338975Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.338975Z"},"links":{"cited_paper":"/paper/2501.19358","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:1c9ca553c5157e99eae0288a9eb8a4a9517e0be322c6834e9c21e007b3f70b5a","observation_id":"2294f5e1-732b-40e7-910a-3e74daaa4d19","resolution":{"observed_at":"2026-08-16T05:40:09.338975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.483224Z","title":"Ouyang, J","venue":null,"work_id":"82cacae4-75dd-4528-a618-e1b1e5d70775","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.344202Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:d78c2016e634aee398f83ac39fedfa2d935c4c2602ba11db5272aa6a52b5b6d1","observation_id":"68bc6e34-2ae4-4707-a5da-c381600b1957","resolution":{"observed_at":"2026-08-16T05:40:10.488096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.466559Z","title":"Ouyang, J","venue":null,"work_id":"21c35911-daf1-4d1e-8650-b184831a8330","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.349041Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:8dd06c09fbdbf582f90319ec2c7d9ffa931d7966750b74f9a7b90e3df0ba5372","observation_id":"1671728b-5791-4991-8af3-1404c6cb7c89","resolution":{"observed_at":"2026-08-16T05:40:10.471645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.449187Z","title":"Ouyang, J","venue":null,"work_id":"0deba0a3-5321-48ef-bbdc-ec78cc67f032","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.353973Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:550c4241b39adc42489d328b4dc3c42e217555a6f9c631254ac39994d9dff4b9","observation_id":"b11e6543-9da9-4bbd-a492-8597831bab04","resolution":{"observed_at":"2026-08-16T05:40:10.454776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.432853Z","title":null,"venue":null,"work_id":"85a60c33-0e99-42c6-b603-7574aa10bbcd","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.358880Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:4390457d4bf53a89fd2f87c94a119c352ff89ff33cbc5a492518946be3796dc3","observation_id":"bcb71774-95aa-431c-bfb5-00ae317dee4e","resolution":{"observed_at":"2026-08-16T05:40:10.437918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.363769Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.363769Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5218213bc26270c3f1e6157dd61d98bb572a87b3c0014449641ca6da9275ab2c","observation_id":"b014d8c6-a3ac-4f19-95ae-579bfc4cf962","resolution":{"observed_at":"2026-08-16T05:40:09.363769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.417267Z","title":null,"venue":null,"work_id":"dc0b5eea-a9ce-4f0a-b25c-d12500b572be","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.369179Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:846d429fa5463bd12381108a476b627af1e5786c52ef0a62aca4cc8c6623444a","observation_id":"cd4b6a38-51b6-4861-8ce8-b0683ac52398","resolution":{"observed_at":"2026-08-16T05:40:10.422198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-16T13:56:25.795152Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-16T05:40:09.374182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.374182Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:83189488d542d37ef4c60151d0a90e963f5ce14b5299175e8c9bcd6f1aa58b9a","observation_id":"cdf3ab89-eaf0-420f-a33d-d487e4804a56","resolution":{"observed_at":"2026-08-16T05:40:09.374182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18439","last_updated":"2025-07-12T20:13:27Z","snapshot_observed_at":"2026-08-16T12:55:16.151952Z","submitted_at":"2025-02-25T18:33:48Z","title":"MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18439","snapshot_observed_at":"2026-08-16T05:40:09.379491Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.379491Z"},"links":{"cited_paper":"/paper/2502.18439","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:97ab4a60c1c068d7006ebe464c5a504c0a3e4a8f1409e20f3b3f687cae76b911","observation_id":"11df0c3d-e5ee-40f6-9677-7e0438431df9","resolution":{"observed_at":"2026-08-16T05:40:09.379491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.384702Z","title":"Perez, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.384702Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:660d11d0edc64cfaf91a0063ed0579b464f18044c1431e6d5a61279f5bee991c","observation_id":"b76ba7ae-bc15-47c3-ad44-1e5664272e99","resolution":{"observed_at":"2026-08-16T05:40:09.384702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T05:40:09.389446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.389446Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b953f7d7a4131406232f5b3b37d383a871461b60b5221840617abbf2eb6108a6","observation_id":"b0d625eb-b103-4a56-b950-355b7800b92d","resolution":{"observed_at":"2026-08-16T05:40:09.389446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.389752Z","title":null,"venue":null,"work_id":"caf75225-4ae5-4338-b59b-630a2198a923","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.394121Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5dc191a2ef76d51dc8804ca303349fac0232d60db4ac90debca7d4d78c9e3f0f","observation_id":"8b2ac55e-fa62-4471-a7a6-955281384036","resolution":{"observed_at":"2026-08-16T05:40:10.394787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18099","last_updated":"2025-07-08T09:49:57Z","snapshot_observed_at":"2026-08-14T01:52:31.273377Z","submitted_at":"2025-01-30T02:21:59Z","title":"Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18099","snapshot_observed_at":"2026-08-16T05:40:09.399353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.399353Z"},"links":{"cited_paper":"/paper/2501.18099","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b6ec154be151631fdeb4f5e2e763ae2c0d667b4accf7bc70a11acf25e9a7507f","observation_id":"ce64f43f-f56f-4ceb-a41b-946b213c5fc1","resolution":{"observed_at":"2026-08-16T05:40:09.399353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10076","last_updated":"2023-10-16T05:19:02Z","snapshot_observed_at":"2026-08-15T01:04:04.066397Z","submitted_at":"2023-10-16T05:19:02Z","title":"Verbosity Bias in Preference Labeling by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10076","snapshot_observed_at":"2026-08-16T05:40:09.404427Z","title":"Saito, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.404427Z"},"links":{"cited_paper":"/paper/2310.10076","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:faf081f9123305930a66671b86978fc5da8be2dad07d56e75bce4beccedc98df","observation_id":"9ac2ff3d-b2bc-488d-a9f0-6c7e6e41f189","resolution":{"observed_at":"2026-08-16T05:40:09.404427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T05:40:09.414460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.414460Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b179a2b5520c98b132e3c9509f63a6840afcdf7b1671939d5643cbcda83d3cc4","observation_id":"1ffa1d05-eec1-4e60-afd8-78932d7724dc","resolution":{"observed_at":"2026-08-16T05:40:09.414460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.373349Z","title":"Sharma, M","venue":null,"work_id":"5b2cbf3c-c801-4a44-a979-f4801219d70a","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.419402Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:1c2f9a1bd31e43d60656d4040e0b7accfc722db8933f47a289127fca00203623","observation_id":"945a2281-cd88-478f-a281-cabf37e7366b","resolution":{"observed_at":"2026-08-16T05:40:10.378237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.355725Z","title":"Singhal, T","venue":null,"work_id":"df1ad410-c4b3-4aa8-a5a3-cc3ef04bb7f4","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.424140Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:676d1475dceeb06f2e4e9aa5b0267e2ca29fd43c3b83b8866dd512403f2a367c","observation_id":"0af90142-28ef-42f0-af13-5cf3c4d47bfc","resolution":{"observed_at":"2026-08-16T05:40:10.361213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.335986Z","title":null,"venue":null,"work_id":"486d83b5-b056-4801-bceb-7cab163710f6","year":2022},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.429286Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:17634a536c9d3043444323b0a51824a515d0515a59b8d306ae99e65840fdf714","observation_id":"e811439f-75ea-4476-9b60-b3b631382a62","resolution":{"observed_at":"2026-08-16T05:40:10.342362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.318755Z","title":"Stiennon, L","venue":null,"work_id":"e1d5ccaa-772f-4565-8eb6-4dff8ebee67a","year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.434243Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:223beace08f22e9c54d096f2cd4ac64fd3194dd3363b40e8166c038d55f8ca8b","observation_id":"22eb0913-acdf-4a0e-b0da-3ae9645d77bd","resolution":{"observed_at":"2026-08-16T05:40:10.324517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.301559Z","title":null,"venue":null,"work_id":"5f72744e-c865-4579-8c58-80077d02ffa8","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.439183Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:b80d7c8bfad602f15651bb0ad3aaf41f567e31a238b4c1387d165b81e03feb7c","observation_id":"d0391c6e-1b24-4948-9b00-a8c2744aa454","resolution":{"observed_at":"2026-08-16T05:40:10.306564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.285776Z","title":null,"venue":null,"work_id":"9f4cac17-18e0-45d7-8e7c-a597d442f4ea","year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.443899Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:df2fc272fd15697f044ccb6897c060d87140685d40ac8f2b44bfc6f1e8fe46c2","observation_id":"ede0c600-1e5e-4546-8b8e-15db8f5c538f","resolution":{"observed_at":"2026-08-16T05:40:10.290637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.269174Z","title":null,"venue":null,"work_id":"202ea4e4-c3fe-4c62-99d7-d8c01724d5ea","year":2006},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.448407Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:e6853cdde60d7b816c56a759cafda7825a29fda9323d2980535d03d7c4bec8de","observation_id":"78c37b0b-b751-4d8c-812b-8f2c0eb3be84","resolution":{"observed_at":"2026-08-16T05:40:10.274336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.453207Z","title":"von Werra, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.453207Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:39b3ebf7dfb05c8d25937ecddfac7c7a42fde64081dff954fe0aed131b9bec52","observation_id":"88e587cd-4c3b-4ad9-93cb-8ef92bdc6926","resolution":{"observed_at":"2026-08-16T05:40:09.453207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.243411Z","title":null,"venue":null,"work_id":"1a46319c-9791-44c7-aed1-9b9306601ee7","year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.458205Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:f107d5b337707d0ac9f00e68cdc8e724a1fdb771e45752d74d986beaf050334a","observation_id":"ceb0dfb0-e5f0-41c0-b2a2-4499233940d3","resolution":{"observed_at":"2026-08-16T05:40:10.248070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.227172Z","title":null,"venue":null,"work_id":"62912071-35b9-425f-a09e-9a2949378d6f","year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.462785Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:3ebb77c00609d9ff195a8518067342ad9de2e8bee7e06e7961e0b15b3aeee032","observation_id":"81672bab-2540-4b7e-a93a-9d2bdb0a2356","resolution":{"observed_at":"2026-08-16T05:40:10.231946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-16T05:40:09.467576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.467576Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:03af75700891c205e41ff9087bcdee39d609b3164bcf9ff2b2601c159690b103","observation_id":"8087916d-e8cb-4716-a863-e32a161a2792","resolution":{"observed_at":"2026-08-16T05:40:09.467576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:10.211112Z","title":null,"venue":null,"work_id":"f71eeede-5196-494f-b8b2-6b1ce439b424","year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.472576Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:a4698c678921c7ca59d726321762d6f7005f5e31ca0b8accc980fcb1bb85084c","observation_id":"9725a20f-ecbb-4e9d-b395-b5b8eff154be","resolution":{"observed_at":"2026-08-16T05:40:10.215955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-16T14:33:39.257972Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-16T05:40:09.477323Z","title":"Xiong, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.477323Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:6062c37427854f9cd8c978482d6f298eeac6af8dded5dbb2113de399b31452d6","observation_id":"d1fea079-aa42-499f-9b4d-ffc4df35466f","resolution":{"observed_at":"2026-08-16T05:40:09.477323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-16T14:31:20.852372Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-16T05:40:09.483189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.483189Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5a7a568de2ff78cb4253fb343dcdd75609dfbf72d0115d0968bffc02d166a466","observation_id":"e727195b-d96b-45c0-b113-21d25c98ee16","resolution":{"observed_at":"2026-08-16T05:40:09.483189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T05:40:09.488443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.488443Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:a7153dd58f62fedd70e2ca946ab3d58b4b6fa99c9c916e9b98dc0fc8b9e51e77","observation_id":"30273e3a-f987-4b7d-9c49-dd0e691a5f71","resolution":{"observed_at":"2026-08-16T05:40:09.488443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-16T05:40:09.493614Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.493614Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:5269d7d1ac94123282296edbc2fc62ae39306944226a15072fff7c777a8a95c1","observation_id":"3a049343-5f77-4b12-ba85-9963fe750d34","resolution":{"observed_at":"2026-08-16T05:40:09.493614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.499053Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.499053Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:2745319bcd6cbfbc4a11eb0e2aa79a4904f20a29d4e9caf8dce5c7b94543a790","observation_id":"f871c059-471c-480a-a2df-30632b8255e1","resolution":{"observed_at":"2026-08-16T05:40:09.499053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16635","last_updated":"2024-10-22T06:19:20Z","snapshot_observed_at":"2026-08-16T14:23:26.502705Z","submitted_at":"2024-01-30T00:17:37Z","title":"Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16635","snapshot_observed_at":"2026-08-16T05:40:09.503684Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.503684Z"},"links":{"cited_paper":"/paper/2401.16635","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:19a4e53a00212c085e257b30066ac4182fb1a9862e5cc4f61cd3f509ce83c5c2","observation_id":"16fbac64-21f1-4c7b-be01-69dcc5635eaa","resolution":{"observed_at":"2026-08-16T05:40:09.503684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-16T05:40:09.508737Z","title":"Zheng, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.508737Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:0582e4545f7bf9ed299ce4bdb4c187d69bdc86906aed4891460a06fbc3c522fa","observation_id":"91dd55db-cff6-4a6f-b309-b58a9a88d1c6","resolution":{"observed_at":"2026-08-16T05:40:09.508737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T05:40:09.518689Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.518689Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:91b532837d4c6010ed6568c850b949affe5115a201ff208d0355d9d5d2202cf5","observation_id":"28dd2998-59d5-438a-8394-5222b09e945c","resolution":{"observed_at":"2026-08-16T05:40:09.518689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.523386Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.523386Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:ad695712ae8de3ab2e4ab2febfe28b5a365b2e1047ec89ed9b807030fc7bb5e8","observation_id":"6aa3b570-ab53-40e2-bba8-cbe2d4dd9940","resolution":{"observed_at":"2026-08-16T05:40:09.523386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:40:09.528530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.528530Z"},"links":{"citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:86118bc6dc1814b935b1f40223fb4bf16b8ff9e2d279baa16a4ce88e2714fc08","observation_id":"725ee1b4-4440-437b-a44b-19c7a9fe4673","resolution":{"observed_at":"2026-08-16T05:40:09.528530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18422","last_updated":"2025-03-20T19:18:24Z","snapshot_observed_at":"2026-08-16T13:30:56.417635Z","submitted_at":"2024-07-25T22:44:39Z","title":"A Black Swan Hypothesis: The Role of Human Irrationality in AI Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18422","snapshot_observed_at":"2026-08-16T05:40:09.533305Z","title":"Back to Basics: Revisiting REINFORCE -Style Optimization for Learning from Human Feedback in LLM s","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T05:40:09.533305Z"},"links":{"cited_paper":"/paper/2407.18422","citing_paper":"/paper/2504.20157"},"observation_digest":"sha256:188c4b453ea97bb94ca1ac18ed230e5d9186d6c250d549b0323b8c408b0e07c7","observation_id":"87e22da6-d4ce-4a22-b621-5a20094e4d05","resolution":{"observed_at":"2026-08-16T05:40:09.533305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T05:34:05.448764Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 3 inbound Pith citation observations for arXiv:2504.20157."}